{"as_of":"2026-08-05T01:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a82caf97541c182705152ff859a728ab69f2087caf52a635e49112319d54a94","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T03:00:10.404757Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:04:09.237686Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T19:40:07.675000Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2604.19485","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19485","snapshot_observed_at":"2026-07-04T19:40:07.675000Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","venue":"cs.LG","work_id":"5b9f69d3-1980-47e7-b470-e4793b65b2ce","year":2026},"citing_paper":{"arxiv_id":"2606.25556","last_updated":"2026-06-24T08:32:42Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T08:32:42Z","title":"BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T21:04:09.237686Z"},"links":{"cited_paper":"/paper/2604.19485","citing_paper":"/paper/2606.25556"},"observation_digest":"sha256:6f4993465eea2df81e73dea626e297309de6d03cc79227907514a603e8cf31ca","observation_id":"3836ffba-fb46-4ec7-9a06-ecfcd9361482","resolution":{"observed_at":"2026-07-04T19:40:07.676769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19485/citation-record","integrity":"/paper/2604.19485/integrity","json":"/paper/2604.19485/citation-record.json","paper":"/paper/2604.19485"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:758cb9e454eecc8fe334c5375749e1dc66168ed5d1a0bbe8128aecfce73761dd","observation_id":"070ed26d-0fa9-424f-9df1-bf4ba480d6f7","resolution":{"observed_at":"2026-05-13T01:42:22.769824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Averaged-dqn: Variance reduction and stabi- lization for deep reinforcement learning","venue":null,"work_id":"0463aa42-8945-43ed-acc3-aed8720168ac","year":2017},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:cc62cd8e6519c29d71f0127a7f0b4ab741314f1d4961dcc9baf027001c305352","observation_id":"ea8e235b-a331-4da2-a83a-26c8f447d281","resolution":{"observed_at":"2026-05-22T18:31:56.607300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23738","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:09:57.399554Z","title":"Gui-shepherd: Reliable process reward and verification for long-sequence gui tasks, September 2025","venue":null,"work_id":"2a04a000-330f-4f22-8384-e173e05a94c9","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:79e5d5f53909087f50a3fc457089378619fa677b6ea0791e69db86f7719f4548","observation_id":"b6d58115-abd7-41f2-b3a2-22602d0f85a2","resolution":{"observed_at":"2026-05-11T12:46:12.588601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning without critics? revisiting grpo in classical reinforcement learning environments","venue":null,"work_id":"621cc83b-ddcd-4443-b1c8-fe04095d0d93","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:28aa05d040ff273dae03836d63c71d570df112298b58abd57c5cc366abf2b633","observation_id":"332ede39-4f3e-4274-a4c8-71f714fb5e3e","resolution":{"observed_at":"2026-05-11T12:46:11.525899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The frozen lake problem","venue":null,"work_id":"c833911d-64eb-4edc-a712-aa712e966938","year":null},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:2f6d8613fd5fb860430d766ce18505b4cdf9da000c12c7858e68234c2c75067e","observation_id":"679eeca9-d734-4a81-b785-a0934aa19ab0","resolution":{"observed_at":"2026-05-22T18:31:56.600144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"publication/3574208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"56cbe6e8-ef6a-4646-a997-ec2a3110b34e","year":null},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:849bc9dd954e2a01479c066b15a38fa5d6db09d6499ba569ea98d142603530f3","observation_id":"ff2ef797-b3f5-4974-b805-8c16a1d9172b","resolution":{"observed_at":"2026-05-11T12:46:13.179286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10343","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:30:07.965211Z","title":"Octobench: Benchmarking scaffold-aware instruction following in repository-grounded agentic coding","venue":null,"work_id":"aad9114e-7032-4d29-b6f0-648fc2f35143","year":2026},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:709e91f8c640e9054a015a7c8d793b0466b793cd8d586bdc75149e9ee441c8ba","observation_id":"0d80652e-ef3e-4c30-b284-ee1ac9ecff8f","resolution":{"observed_at":"2026-05-11T12:46:11.316396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentic reinforced policy optimization","venue":null,"work_id":"3f70d92f-7137-4f65-8c84-2aee62409fbc","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:74480e6472e90c0f979bd3c840bbadf155d02a13a4ffb978bdc2bc1f48371569","observation_id":"9eb9b35f-10ab-4888-a16d-22fd91e52edc","resolution":{"observed_at":"2026-05-22T18:31:56.596152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03587","doi":"10.48550/arxiv.2602.03587","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Cl-bench: A benchmark for context learning","venue":null,"work_id":"4d10e4c6-07c6-47a2-bf06-94046a4b3d1a","year":2026},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:b124abe8b9e3a12be45d8282f48355ffb8ada3ae1157135c4fb9cdc2aceae9f4","observation_id":"87b51482-1e6f-432c-a924-af2097d3298d","resolution":{"observed_at":"2026-05-11T12:46:11.131519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.04025","last_updated":"2020-11-20T16:04:51Z","snapshot_observed_at":"2026-07-06T07:44:38.449115Z","submitted_at":"2019-04-08T12:53:12Z","title":"Only Relevant Information Matters: Filtering Out Noisy Samples to Boost RL","version":5},"cited_work":{"arxiv_id":"1904.04025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.04025","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Only relevant information matters: Filtering out noisy samples to boost rl, April 2019","venue":null,"work_id":"4780617a-756e-4788-82bc-99ba43950f60","year":2019},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/1904.04025","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:e9ee4638cbfddb105b625f95b6cbff76d143e68a53d1a512b046ef8ad9bdfcf5","observation_id":"0a1771d8-2915-4fb5-aa69-ac94eba01aa5","resolution":{"observed_at":"2026-05-11T12:46:13.306057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:a68dd566c4673b564d54d3a56c6878137c2605e28b282a12a3f5e15acbb70043","observation_id":"0fe7c71c-3124-4601-ad39-b82e6c7743c7","resolution":{"observed_at":"2026-05-10T03:03:36.750129Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:24cfb6a8669d342a507201ee0cedb2f4bb1d479e23782feadc8164f2d55fc6c3","observation_id":"604f67c0-6e79-480a-80db-ac9a988ea258","resolution":{"observed_at":"2026-05-12T09:21:45.673967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards understanding the optimization landscape of grpo and its variants","venue":null,"work_id":"e310a9da-6d34-41a8-9e80-b392f176bc77","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:5fe3aba15c5f071e34bb2ba4b37f7215c53abbd72277819906a2d6929ba4ec79","observation_id":"261bab36-5b15-41f4-8a4a-8e3d40d46b55","resolution":{"observed_at":"2026-05-22T18:31:56.590129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0004-3702(01)00109-6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sokoban: Enhancing general single-agent search methods using domain knowledge , journal =","venue":null,"work_id":"6bae6669-20cc-4d43-a6a0-a9a4019826d3","year":2001},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:fce220f5c20a37976c87a582676b095d356cc413285ccd01a1a312af193cf2af","observation_id":"73a1a290-0e49-44ed-a61a-904f345cb386","resolution":{"observed_at":"2026-05-10T03:03:36.747580Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1115/1.3662552","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:26:42.761061Z","title":"A new approach to linear filtering and prediction problems","venue":"Journal of Basic Engineering","work_id":"e387689e-f71d-4600-b23e-c742df2e23ae","year":1960},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:9ea827e395ec2680914bcfa134c61938e0de6f8e7fae8087551e0813f9756634","observation_id":"50c061d6-43fa-463f-b808-620fd33aec06","resolution":{"observed_at":"2026-05-10T03:03:36.745652Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:17.538025+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:17.538025+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying ppo, dpo, and grpo: A theoretical and empirical study on llm post-training, November 2025","venue":null,"work_id":"49fa3614-a163-4470-be5f-6e3887de9324","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:eb4f69efdce2934c250087090d4e95e1ee35e59066d28e15475a758f2547da32","observation_id":"b52747d3-c75b-4382-a88f-5cc3f1972bfd","resolution":{"observed_at":"2026-05-22T18:31:56.584422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-doc-r1: Training agents for long document visual question answering through multi-turn reinforcement learning, April 2026","venue":null,"work_id":"00a5c848-bd29-4f00-a8ff-fcfe1883cd1f","year":2026},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:94add4ee56df44c4d27bcb8c5ca9814150deb44b7fd18552e62b9543d1a65b01","observation_id":"649c0255-4eee-4e12-89dd-4635c3126c8f","resolution":{"observed_at":"2026-05-22T18:31:56.586406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proximal policy optimization with adaptive generalized advantage estimate: Critic- aware refinements","venue":null,"work_id":"16ba78bc-7c3c-4e1d-ba31-2588f624e987","year":2024},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:26ec80813c205151f81a2df73d15126ff42b367b5d856cb9b101917a69788306","observation_id":"7396d07c-85f9-4598-a8ed-c75c020622f8","resolution":{"observed_at":"2026-05-22T18:31:56.588276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:893c6cb7aa4d3a05ba15e25704056b08be423b8778c65b17531368c419242558","observation_id":"52df4864-6f2b-440c-af71-48e8a41e4311","resolution":{"observed_at":"2026-05-11T12:46:10.654980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.04055","last_updated":"2019-06-27T18:13:46Z","snapshot_observed_at":"2026-07-06T06:03:43.625152Z","submitted_at":"2017-10-09T23:29:45Z","title":"An Elementary Introduction to Kalman Filtering","version":5},"cited_work":{"arxiv_id":"1710.04055","doi":"10.48550/arxiv.1710.04055.url:https://arxiv","metadata_source":"pith","pith_arxiv_id":"1710.04055","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Fussell, and Keshav Pingali","venue":"eess.SY","work_id":"d771f913-340f-4085-88f7-a7be1f73a99c","year":2017},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/1710.04055","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:956bb30f8418bf52491bb407504d31c6a77a289c4dd8d1bb0527d902a931e4c3","observation_id":"538fc613-7358-4188-bcca-00317d9669f3","resolution":{"observed_at":"2026-05-11T12:46:12.249347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:33b951690dbfa4e5cbd4458bd127a65adce818536fbfe53c6a4f6a271cc5b2e9","observation_id":"d364b24c-9873-4bd4-bda2-afe96b0aeef1","resolution":{"observed_at":"2026-05-11T12:46:12.105785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.537124Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":"cc4c64ce-0924-409b-b18c-3cb7c4f8ec8c","year":2026},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:15ece0154428e9bfd62e4afe5376194ce8cdbc4865d986c50b7f1f2acc8819cd","observation_id":"43ac8606-efac-4d49-8654-aebead90d3e9","resolution":{"observed_at":"2026-05-22T18:31:56.592566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The nuts and bolts of deep rl research, December 2016","venue":null,"work_id":"a4c690ad-4e77-4c25-946c-06bd6e280c80","year":2016},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:efb6efdcf7301145a6e2efa5159c172c3537009ae72c4e206c11c61dda9568a8","observation_id":"cadac5ea-75f9-442a-93de-d8ae094f112d","resolution":{"observed_at":"2026-05-22T18:31:56.582364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:f66b756ac1da3044aa739b353a5ec03d20695705e890f2a9b0d7b1a214671258","observation_id":"08c7aba5-b672-4e70-847d-eafbee323e6b","resolution":{"observed_at":"2026-05-11T12:46:12.712352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-07-11T03:57:46.887146Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:3bd053ab3b9c113cce3c96c830c8d448c415e90cdc514b6c6562bcc3051f4396","observation_id":"b008bad2-a9b0-422f-a879-59dfd3f8a87f","resolution":{"observed_at":"2026-05-11T12:46:11.006886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:e67d71d0b057125150d4166b674b42472a8c200415f09c226048856a25a0c695","observation_id":"04d1690d-680f-4dac-8a2a-8c8b2bae3462","resolution":{"observed_at":"2026-05-11T12:46:11.484943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":"2010.03768","doi":"10.1109/cvpr.2001.990517","metadata_source":"pith","pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","venue":"cs.CL","work_id":"fa436f46-ec0a-4d2e-a0ff-e697def4a7be","year":2020},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:53753f7f6b334c1a7a10320cc0fc68bd6bd1d7c01e65068bece58e2529b2643d","observation_id":"2beded7a-e5e3-42dd-ade5-0726477dbc3b","resolution":{"observed_at":"2026-05-12T06:39:15.970362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a995e1d-1c04-457a-8ae0-ea579411b20b","year":null},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:a43f01cd9e0db7802941c78124e6db08292836bb8efadb96afb44abdc562ba7d","observation_id":"121a48e8-329f-4a80-986e-58ba0a5f12b9","resolution":{"observed_at":"2026-05-22T18:31:56.594358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T02:17:46.480513Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:e3b1059b8cdb754354ff4e313c8b52877efd7442bd5ed16f4643bb9860cac006","observation_id":"ae39a11b-b775-4b53-9ea8-f83edfa691d0","resolution":{"observed_at":"2026-05-11T12:46:12.427917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation","venue":null,"work_id":"5e6dc9fc-e040-4f13-895a-c13a6d318035","year":1999},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:f167fcef70830be5ef60f93912732a4b0075545938f0b6fb638cf8d59dfd6655","observation_id":"9de7384c-f87e-4d37-b39a-f70f4276010e","resolution":{"observed_at":"2026-05-22T18:31:56.598210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":"4a39c5d6-e90e-4d23-878e-118f0869e41b","year":null},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:48007fd844be6a7dad570eec2e0400e5cfdbf4f421ee03db8791f6cf77787726","observation_id":"dac46bdd-4f89-495d-b50c-492ca214988c","resolution":{"observed_at":"2026-05-22T18:31:56.605493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.410","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:02:01.421191Z","title":"R e FT : Reasoning with reinforced fine-tuning","venue":null,"work_id":"336896b7-87f2-42e9-bc33-af3376adccf7","year":2024},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:c535d690c65acda0eeab25c17469cffb3487249cdb79ec8a353dea74f1a4cec8","observation_id":"aeed9c43-44f7-4d04-ac8c-0b077318213c","resolution":{"observed_at":"2026-05-10T03:03:36.754019Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing llm-based search agents via contribution weighted group relative policy optimization, April","venue":null,"work_id":"fa30f8d1-1112-4749-9e20-92f494a0668a","year":null},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:104dc00557a14f113b2525e4242b7c1f32d7118563ce0e193ea6493a36e33515","observation_id":"799d480a-dd61-466a-a561-bff8d4801995","resolution":{"observed_at":"2026-05-22T18:31:56.602025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14267","last_updated":"2026-04-20T14:14:42Z","snapshot_observed_at":"2026-07-31T07:26:56.682540Z","submitted_at":"2026-04-15T17:37:59Z","title":"Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":"2604.14267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization","venue":"cs.LG","work_id":"3473ea9d-6d21-4248-a32e-7de9f04ead7b","year":2026},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2604.14267","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:71bd24162e9a3b165bfbcffd643d7f8733d1f66b3fc9bf8cee8c27d4b74b1442","observation_id":"62ffc7c2-1021-4394-bd72-5fc45a609449","resolution":{"observed_at":"2026-05-11T12:46:13.099355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.20073","doi":"10.18653/v1/2025.acl-long.887","metadata_source":"pith","pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","venue":"cs.LG","work_id":"b96383ee-f8dc-471f-aba4-bc5ce9b0b632","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:5e9e18ea454742b403d95ac0d477c2cb9caa1f25a8223364ea8d805324018b72","observation_id":"f2bb9c72-46d1-47e0-917c-46b24afd5490","resolution":{"observed_at":"2026-05-13T07:13:34.687091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf00992696","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:47:34.373100Z","title":"Williams","venue":"Machine Learning","work_id":"469b3b81-55f9-4542-9dd7-570a63cfda74","year":1992},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:7a131c4ec4bd881cea7deba590a9683efad7a96f4da50aca066c2ce254ae26f1","observation_id":"479d39b5-3732-47da-91e6-59dcba4a505f","resolution":{"observed_at":"2026-05-10T03:03:36.752206Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-18T14:51:33.972563+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T14:51:33.972563+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:714f32999409688a94719cf383b797defa2853acedbc990cfcb13d542702457b","observation_id":"ec79021b-ecc1-44a4-a376-adf6d1657c86","resolution":{"observed_at":"2026-05-11T12:46:13.749355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Narasimhan","venue":null,"work_id":"7b5e70a9-b0be-4740-bce2-62bf7cea8a6f","year":2022},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:04e10454a43b4cabd776c400a29e3f971cd141ac9b7c854a3af1f350148d7c18","observation_id":"849d9d33-71e8-4e6e-8cfc-14f36a3d2ac5","resolution":{"observed_at":"2026-05-22T18:31:56.603672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:f19942ead708dd85e8d1dfaf39485c0de66bc30c65af4f2ec097aecfbdbc73bb","observation_id":"4c688259-e04a-42df-b0b1-1e60db5871f8","resolution":{"observed_at":"2026-05-11T12:46:13.509807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":"2307.04964","doi":"10.48550/arxiv.2307.04964","metadata_source":"pith","pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","venue":"cs.CL","work_id":"e3d402e3-52dc-466f-998e-a8932c1b0bfc","year":2023},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:0af78f91ec0e231d99e3195a6a167d0d066bc07eef399d03b2011a3ae1d67d2d","observation_id":"337a1bbe-7e7d-4c1c-99fd-a31b223f6a84","resolution":{"observed_at":"2026-05-17T13:17:43.137115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-10T12:07:03.672931Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T03:00:10.404757Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2604.19485"},"observation_digest":"sha256:cf0e2ca16395d82f9d6703c76bf3a8ac0ea3319bf3423731c2ce095e9175f4df","observation_id":"178facb6-b1e2-4c5c-9dc9-07f81c80c4a5","resolution":{"observed_at":"2026-05-11T12:46:12.866351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19485","last_updated":"2026-04-21T14:07:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:07:39Z","title":"EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":26,"verified_fuzzy":13},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2604.19485."}