{"as_of":"2026-08-07T22:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ab545b5bb5ca9f3d518eea2b235875cae3ae32dac97b62ad06beb42b9c1e4bf","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:21:28.356097Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:30:45.506154Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":269,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:50603d0591cf4dc05241f90652d52f6b41e7fd079507a0e70044aa8ad0f8c30a","observation_id":"6287142b-4835-4649-bbb1-98811edc27ab","resolution":{"observed_at":"2026-05-18T19:21:48.666577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-04T09:33:42.644462Z","title":"num_train_epochs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-05T04:35:32.361585Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.644462Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:ca63c7e3dbb39cf119cff1eb2ebc7a50f399db8b93b11db903edb71f0cf3c178","observation_id":"f88f39fd-5a20-47bc-aadf-f41e12188cba","resolution":{"observed_at":"2026-08-04T09:33:42.644462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:36e7c1bf2cae60213e8f1b61fbdb076c0b3fce4d67304ed6d61260bb0e8dce2e","observation_id":"78e53603-8078-4053-9f3f-5712016ef43b","resolution":{"observed_at":"2026-05-16T22:38:37.689797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:cd0ef2252e0350a3f72b8fae1b08dcebf0631146a784dcaac3f8624836baf35a","observation_id":"cc3355c7-9b12-4dc7-a994-69ceeb212dce","resolution":{"observed_at":"2026-05-17T15:14:26.310487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:22f4bfd1873c05bd5f122f6717ff9864f08aae161c97c3c0bf12380a6376713d","observation_id":"d56dd12c-0b56-454d-9b81-0981a35525cc","resolution":{"observed_at":"2026-05-11T05:15:57.001034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2604.17399","last_updated":"2026-04-19T12:02:30Z","snapshot_observed_at":"2026-08-07T14:21:17.351574Z","submitted_at":"2026-04-19T12:02:30Z","title":"Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-10T06:14:19.580071Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2604.17399"},"observation_digest":"sha256:ceaee06a8f67133952379329de7c52b0dc63fd956dfd6f1300f48d4a82e2b775","observation_id":"f6a405de-44c1-43f2-951e-dde3dce430d5","resolution":{"observed_at":"2026-05-10T06:21:27.129260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2604.24320","last_updated":"2026-04-27T11:09:49Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:09:49Z","title":"DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:37:30.156901Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2604.24320"},"observation_digest":"sha256:076efe6f712e3b82753df5aff3ac88ffb5ec0345d8e4fa12a63af7f47fc9124f","observation_id":"7b8b3264-a6b4-4a55-b1a6-37108d034a8e","resolution":{"observed_at":"2026-05-11T22:01:11.869722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2605.21951","last_updated":"2026-05-21T03:35:10Z","snapshot_observed_at":"2026-07-31T14:36:47.956964Z","submitted_at":"2026-05-21T03:35:10Z","title":"Dynamic Mixture of Latent Memories for Self-Evolving Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T07:38:42.113849Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2605.21951"},"observation_digest":"sha256:065823f9f2896a9424b786b2ea842a97419f880489f8d3dc165c6b0bedd869d9","observation_id":"888a8468-6fc4-4324-bb82-018071e57209","resolution":{"observed_at":"2026-05-22T07:41:14.489608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2605.23989","last_updated":"2026-05-17T10:26:37Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-17T10:26:37Z","title":"Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security","version":1},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-06-30T19:18:40.244556Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2605.23989"},"observation_digest":"sha256:aba63bc2df3fea6e4e522ff2d05b243b9a241d5b79dade6ca3ec429ac2d9df3d","observation_id":"2e1cd5bb-ed16-4e47-87b1-71e7a414d50f","resolution":{"observed_at":"2026-06-30T19:45:01.653011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:24917125060764ce4abcc4ae27add5fed9c5a6839bbb079726c391bc42c24954","observation_id":"66fbc2e9-14e9-4686-ae43-08548ab38b29","resolution":{"observed_at":"2026-07-03T20:38:55.863082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2606.25852","last_updated":"2026-06-24T14:02:13Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:02:13Z","title":"Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-25T20:16:39.347676Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2606.25852"},"observation_digest":"sha256:2897a290c6d111b927128e8247c6b0319bcd905cbf010af43839df05dfc0cec9","observation_id":"158c06d6-9cc9-4393-841d-356cfdfb1d41","resolution":{"observed_at":"2026-07-04T20:20:07.618792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2606.26918","last_updated":"2026-06-25T11:53:41Z","snapshot_observed_at":"2026-08-07T14:15:31.695220Z","submitted_at":"2026-06-25T11:53:41Z","title":"Diagnosing Task Insensitivity in Language Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:11.929896Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2606.26918"},"observation_digest":"sha256:de2a6fa611efa0f69c16bd95fd5fd45ee33f0aee76401174fb9578f481125836","observation_id":"447b24f9-a4f4-4440-bff1-ce73c7e0bc3b","resolution":{"observed_at":"2026-07-04T13:39:51.548061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2606.26935","last_updated":"2026-06-25T12:09:16Z","snapshot_observed_at":"2026-08-05T08:46:41.476055Z","submitted_at":"2026-06-25T12:09:16Z","title":"Where Do CoT Training Gains Land in LLM based Agents?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T04:55:14.293452Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2606.26935"},"observation_digest":"sha256:f7de042196d70291f8c256acb56098e38f2b23ca7aef0739fe43d074ea3decb4","observation_id":"578e9c1e-430f-4a6a-84b3-78e2a06df079","resolution":{"observed_at":"2026-07-04T13:49:51.517553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"Rlvmr: Reinforce- ment learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-07T20:40:56.219597Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:beed63230c5f1d5d1d45f0ea267326535c944de7983da450cbeb317d44a1f875","observation_id":"ac00b5aa-cc46-41ed-bd85-c273d00a1419","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2507.22844 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-03T04:57:20.508738Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:086868e39b19569aa2cb6c6715b6e21fdf215bc0b2e1012ebcdd8f171d4b587e","observation_id":"f39e0090-b9af-40e9-bb51-fdc755be7ea1","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-31T21:44:39.696164Z","title":"Rlvmr: Reinforce- ment learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-06T03:40:42.643302Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.696164Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:a263e645a96049a2bf417706bbbaf767f7340739c05eea850412eacf8936f6cd","observation_id":"6198f19b-ce98-49eb-b616-8555e4fa7ad7","resolution":{"observed_at":"2026-07-31T21:44:39.696164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-06T04:30:45.506154Z","title":"RLVMR: Reinforcement learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-07T21:19:39.541746Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.506154Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:d99df713b19ed9b4a23f9c30f9c0523b01a77f78a9211c08a55b3921ca04500b","observation_id":"0506bd30-63bc-448a-84f7-bf8d05965137","resolution":{"observed_at":"2026-08-06T04:30:45.506154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22844/citation-record","integrity":"/paper/2507.22844/integrity","json":"/paper/2507.22844/citation-record.json","paper":"/paper/2507.22844"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:24.792677Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:24.792677Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:76e6d99b65165da5e0d1f6025caa4a29f40f382aa68b39d31bc4c8f9e5e9da46","observation_id":"e7c58f48-76bb-413a-98aa-c35e51c3c875","resolution":{"observed_at":"2026-08-06T11:21:24.792677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13032","last_updated":"2024-07-17T21:44:28Z","snapshot_observed_at":"2026-08-07T16:45:05.155981Z","submitted_at":"2024-07-17T21:44:28Z","title":"Agent-E: From Autonomous Web Navigation to Foundational Design Principles in Agentic Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13032","snapshot_observed_at":"2026-08-06T11:21:24.872638Z","title":"Agent-e: From autonomous web navigation to foundational design principles in agentic systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:24.872638Z"},"links":{"cited_paper":"/paper/2407.13032","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:9e97567fb3abbad0a51dda920e7824d8613eb7ca2935419c0269dc3176ce76f9","observation_id":"72841eb2-0aa8-436d-b40a-c3721397a918","resolution":{"observed_at":"2026-08-06T11:21:24.872638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08164","last_updated":"2024-10-10T17:43:51Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:43:51Z","title":"Agent S: An Open Agentic Framework that Uses Computers Like a Human","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08164","snapshot_observed_at":"2026-08-06T11:21:24.987699Z","title":"Agent s: An open agentic framework that uses computers like a human","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:24.987699Z"},"links":{"cited_paper":"/paper/2410.08164","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:988b2cff82702d4577edf48ebb61b6aae1caea3767de40216c87ea4faa652fd8","observation_id":"9dc625d8-f4ac-4e88-9ede-8385014f4c27","resolution":{"observed_at":"2026-08-06T11:21:24.987699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:25.067188Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.067188Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:ad4dcd13720d56b71c86a59de9b1602f7516c847bdc9ae429152e4f42ae987b5","observation_id":"f424d337-8c80-48a4-bd9c-b09ce0e5aaff","resolution":{"observed_at":"2026-08-06T11:21:25.067188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T11:21:25.125749Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.125749Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:0368c9a867bb00c30ae2add1ad4f4d3c6dadfc7c03db95968d986bf56a19cc23","observation_id":"5674a6bd-a0c9-4192-9ca1-59e68115dd09","resolution":{"observed_at":"2026-08-06T11:21:25.125749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-06T11:21:25.329821Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.329821Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:8cd18878097924947d9839b55c39dbc5eca072122bf8813ffb4ac38db371a66a","observation_id":"44cf0d7b-ee2a-4185-b330-e95e284b7f69","resolution":{"observed_at":"2026-08-06T11:21:25.329821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01702","last_updated":"2025-02-24T12:42:14Z","snapshot_observed_at":"2026-08-04T06:57:08.014747Z","submitted_at":"2025-01-03T08:55:19Z","title":"AgentRefine: Enhancing Agent Generalization through Refinement Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01702","snapshot_observed_at":"2026-08-06T11:21:25.444678Z","title":"Agentrefine: Enhancing agent generalization through refinement tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.444678Z"},"links":{"cited_paper":"/paper/2501.01702","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:b5f9b5f112b389862c1fd376525e6b918a23c6c3989975038cc842bf68c79d94","observation_id":"6a5dedfc-061a-41d8-b712-4157991f9fe6","resolution":{"observed_at":"2026-08-06T11:21:25.444678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T11:21:25.567372Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.567372Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:a607b922279fd0c2e80ddb9e2b327cd1ea3e8866896be7349af4a6bf54b96f76","observation_id":"18f457d4-de31-4c72-9787-60e7588b2d40","resolution":{"observed_at":"2026-08-06T11:21:25.567372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13010","last_updated":"2024-05-24T11:47:24Z","snapshot_observed_at":"2026-07-06T17:05:56.282078Z","submitted_at":"2023-12-20T13:22:41Z","title":"AgentCoder: Multi-Agent-based Code Generation with Iterative Testing and Optimisation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13010","snapshot_observed_at":"2026-08-06T11:21:25.638167Z","title":"Agentcoder: Multi-agent-based code generation with iterative testing and optimisation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.638167Z"},"links":{"cited_paper":"/paper/2312.13010","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:9af056a6615badbbc2bf2b599286a86469bc4b61f77b1dd65fffec3d0bafad3f","observation_id":"5a35479b-97f9-44cd-9b9e-a06361e5caf5","resolution":{"observed_at":"2026-08-06T11:21:25.638167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:25.727837Z","title":"Metacognition: A literature review","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.727837Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:20df6d6bb34a291d09788b78bc3b71bf72eba7a07d4eac72da0652514b1c3b61","observation_id":"0fc1466c-d69b-4818-89f7-d6e44b0c8948","resolution":{"observed_at":"2026-08-06T11:21:25.727837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T11:21:25.854273Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.854273Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:f5cca41d50504aa02960c298f0fe575418972e7bd690e89dc44c4a646c1312a7","observation_id":"cde1e6f9-84a8-428e-b73f-c8c6931e5a7a","resolution":{"observed_at":"2026-08-06T11:21:25.854273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:30.164748Z","title":"What is metacognition? Phi delta kappan, 87 0 (9): 0 696--699, 2006","venue":null,"work_id":"b7565dff-3705-4a15-bd79-cca7b6323a0e","year":2006},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.985422Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:e08d206e08e96ea4ae9420e2c5248cb1fa58fc8c736f7df5d5ec1cf858ab976d","observation_id":"817d8432-6a6f-4089-8efc-f47b2bf6237f","resolution":{"observed_at":"2026-08-06T11:21:30.281687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T11:21:26.067539Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.067539Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:419d3ea493c26dd5676f832e883425264ea967caf4a994781e015ce911c0a17e","observation_id":"007c1f90-e20e-4186-91c2-bda3619ad0a0","resolution":{"observed_at":"2026-08-06T11:21:26.067539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.137344Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.137344Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:76f3118da5e8f06ce49fcb84b0dc5b42c7031a2354f7980e13214cfb702a7c80","observation_id":"374bf8bd-f7b8-4394-ad92-958409523872","resolution":{"observed_at":"2026-08-06T11:21:26.137344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.972697Z","title":"Agent planning with world knowledge model","venue":null,"work_id":"fdc116d0-93a4-4b85-b2e7-b551a43c19f4","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.223002Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:f43130c804dc65a75adc8c5b5c74f1fbfa540e1abf990b14d77690955894cb2c","observation_id":"061d84b4-3439-411b-9caf-109d8861021b","resolution":{"observed_at":"2026-08-06T11:21:30.038442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.314995Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.314995Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:5d192e2a1b41472a337f3563bc323adf310aca63d47561d325976349ab715f39","observation_id":"18d5201c-9847-4104-af5f-a46c1601b22d","resolution":{"observed_at":"2026-08-06T11:21:26.314995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.421243Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.421243Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:11257489c2e54a4a850191d6f14f8c159452b15ca8b67fa1bc71adddb61476ff","observation_id":"51f230ed-348e-4100-9b70-4447b6362e8a","resolution":{"observed_at":"2026-08-06T11:21:26.421243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T11:21:26.503078Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.503078Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:b19476fba6cfc12b8125261ee5a51ddf254b84fe72d5cc64303732a8b9adc3f4","observation_id":"8d481db7-b25b-40e1-9bfe-246c62bd71f2","resolution":{"observed_at":"2026-08-06T11:21:26.503078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.592831Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.592831Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:dafad092a5bf455e1e27bd5bab5e8f7e9c70d38dd9725f7ef2b7123e176a36f5","observation_id":"112a0911-c508-46da-9e21-daae599e1215","resolution":{"observed_at":"2026-08-06T11:21:26.592831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-06T11:21:26.682417Z","title":"Alfworld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.682417Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:3569d5e09e1880e4eb754bb14d2c9354b60a273fd872fd2ef614abd91b906468","observation_id":"dfcea7cb-7364-4fa2-9355-f9cb34de8804","resolution":{"observed_at":"2026-08-06T11:21:26.682417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-07-06T17:39:32.800594Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-06T11:21:26.783454Z","title":"Trial and error: Exploration-based trajectory optimization for llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.783454Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:73ea9d0128ff74c6a6966cd0917310125336dee7eff7c4a90be2a49dd85b995a","observation_id":"2a88c7ea-1fe7-4db2-a16c-6ba094467c5d","resolution":{"observed_at":"2026-08-06T11:21:26.783454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05301","last_updated":"2023-09-07T12:20:45Z","snapshot_observed_at":"2026-07-06T15:40:20.267344Z","submitted_at":"2023-06-08T15:46:32Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05301","snapshot_observed_at":"2026-08-06T11:21:26.873512Z","title":"Toolalpaca: Generalized tool learning for language models with 3000 simulated cases","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.873512Z"},"links":{"cited_paper":"/paper/2306.05301","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:07cb75414ee0654e40d4062f6919cf42fb188d1ec17b5354f5f4c592f59c02a9","observation_id":"d29c7ebc-a2f0-4396-8f4c-2eb7f8f98d5e","resolution":{"observed_at":"2026-08-06T11:21:26.873512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.966172Z","title":"Rlver: Reinforcement learning with verifiable emotion rewards for empathetic agents, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.966172Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:5a4680e9ea68c33c13a769f2aa39b49e68a8788c5886c263fa25f4eb7c58afda","observation_id":"d6640c1a-146f-451c-a166-5b508956f7d4","resolution":{"observed_at":"2026-08-06T11:21:26.966172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07540","last_updated":"2022-11-14T17:52:27Z","snapshot_observed_at":"2026-08-06T07:25:42.562786Z","submitted_at":"2022-03-14T22:52:34Z","title":"ScienceWorld: Is your Agent Smarter than a 5th Grader?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07540","snapshot_observed_at":"2026-08-06T11:21:27.035759Z","title":"Scienceworld: Is your agent smarter than a 5th grader? arXiv preprint arXiv:2203.07540, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.035759Z"},"links":{"cited_paper":"/paper/2203.07540","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:daedf4d4b7293a45e6d9c907de2792bb8b18c57f7be64c9cad2f1d82faceb5dd","observation_id":"1167c757-ae55-4ed4-8b77-4258b14823ad","resolution":{"observed_at":"2026-08-06T11:21:27.035759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-06T11:21:27.115747Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.115747Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:066b1944c7091cf5628e9cf6bd34e9f2d5872bb4c90b2f18063dc890ad4d8a3f","observation_id":"fecd4649-0c8e-472b-b9fe-1391c4ebe95b","resolution":{"observed_at":"2026-08-06T11:21:27.115747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04151","last_updated":"2024-06-06T15:15:41Z","snapshot_observed_at":"2026-08-06T10:07:32.780355Z","submitted_at":"2024-06-06T15:15:41Z","title":"AgentGym: Evolving Large Language Model-based Agents across Diverse Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04151","snapshot_observed_at":"2026-08-06T11:21:27.211465Z","title":"Agentgym: Evolving large language model-based agents across diverse environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.211465Z"},"links":{"cited_paper":"/paper/2406.04151","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:9c683bd700241be694724689a8ae57c2ccbf5762e4800836700f6e634f54a6b4","observation_id":"68c40d27-ad2e-4f13-ad10-91e3b1feebb7","resolution":{"observed_at":"2026-08-06T11:21:27.211465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.777685Z","title":"Watch every step! llm agent learning via iterative step-level process refinement","venue":null,"work_id":"2eac5b95-eefa-478b-9ac3-6c1f5d550f8e","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.280991Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:fc8c763da565e837c2d82ee310e7700c9a8297fb6e1cf4f97b9d6e0ed5892ee1","observation_id":"53bb5053-9869-445c-bca5-48a438f958b9","resolution":{"observed_at":"2026-08-06T11:21:29.861644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.572637Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction","venue":null,"work_id":"4f64850c-ce8e-4523-b285-215cce2b3009","year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.338862Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:ea063084f5f036e6604f6ed0250a3991176ac5a0315cbb9bf6509308e21ae1b9","observation_id":"b9d66c38-59b3-44df-90a4-7ab831707a05","resolution":{"observed_at":"2026-08-06T11:21:29.668964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:27.421252Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.421252Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:4005b9e127e37834da40b12e92744c1e2722ee50a9016591f6dce3071c2d433e","observation_id":"e2ce4d8a-523d-4628-9b25-cbf8384ce39d","resolution":{"observed_at":"2026-08-06T11:21:27.421252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T11:21:27.471376Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.471376Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:d5629dd88f0e9314d88ac19f41c449e419994e2dc270996c749d6c3e8458a6ab","observation_id":"73c28fc9-fde8-4682-b1d7-5de80f019aea","resolution":{"observed_at":"2026-08-06T11:21:27.471376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.331839Z","title":"Steptool: A step-grained reinforcement learning framework for tool learning in llms","venue":null,"work_id":"952eab46-9613-46cb-b582-a63da3e040e6","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.587989Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:186717041a17f3ac395655303d2650aa71abfcbaf4b8a7dbc9f5d367389bde20","observation_id":"47c97e62-e927-4e3c-b70f-fb2bdc07b4b2","resolution":{"observed_at":"2026-08-06T11:21:29.450056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-07-06T20:23:22.709846Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-06T11:21:27.676834Z","title":"Agent-r: Training language model agents to reflect via iterative self-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.676834Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:e073447b39cfe7a3e007750d8618cf106897ce2d8c39d0bb363dc144ba7e529c","observation_id":"51204792-88b2-4000-8f53-bc77a7647bbc","resolution":{"observed_at":"2026-08-06T11:21:27.676834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.209014Z","title":"Agenttuning: Enabling generalized agent abilities for llms","venue":null,"work_id":"2ac5fc7b-0a51-4d1f-bcc2-6787f1185fc5","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.740567Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:4440ba93b77825eef87ab2633e1d56e2f1fad88e5312e109b98b59de393d4d83","observation_id":"068f6e9c-9c79-462c-83e9-a33b13845154","resolution":{"observed_at":"2026-08-06T11:21:29.284262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02847","last_updated":"2025-05-21T13:45:40Z","snapshot_observed_at":"2026-08-07T15:57:16.954779Z","submitted_at":"2025-05-01T19:06:10Z","title":"Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02847","snapshot_observed_at":"2026-08-06T11:21:27.805649Z","title":"Sentient agent as a judge: Evaluating higher-order social cognition in large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.805649Z"},"links":{"cited_paper":"/paper/2505.02847","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:b84519ddb22576264f0cb0c7613bfb24175576e95f167b98b9bd87cbce053860","observation_id":"9af3635a-dd82-4606-a094-4d03986b4492","resolution":{"observed_at":"2026-08-06T11:21:27.805649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:27.893716Z","title":"Codeagent: Enhancing code generation with tool-integrated agent systems for real-world repo-level coding challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.893716Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:f6288cea7555b6171480c504dc743e20ee14691081f4be498149666334fe9c02","observation_id":"fd3ffdca-1885-46b0-adfc-0d47dec6e9fb","resolution":{"observed_at":"2026-08-06T11:21:27.893716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.005304Z","title":"You only look at screens: Multimodal chain-of-action agents","venue":null,"work_id":"29206953-c1e8-47a6-82d6-e4ce2777dec4","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.988018Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:ec3792847140844f289c40be4cd64d86414705dc1cedfb820b0d6bb5ab1b52e9","observation_id":"b5e28e93-3f2c-446c-bb61-04b4a72ae661","resolution":{"observed_at":"2026-08-06T11:21:29.105836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:28.841358Z","title":"Archer: training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"4c36a344-860e-449d-8098-dbcb429f9326","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:28.082695Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:a969c350e89ee152b4ffbc0d8359c423a943b39098ab963ec06d3dae75fa3efb","observation_id":"fab776c0-00c2-49ae-91bc-fa9fe8e225d6","resolution":{"observed_at":"2026-08-06T11:21:28.945122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:28.176007Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:28.176007Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:30857d888a4f27a8014653def358179361b28f73681af591130070300d3d9c1e","observation_id":"ffe30d0c-eb40-4678-a19d-6972570fabd9","resolution":{"observed_at":"2026-08-06T11:21:28.176007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:28.285293Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:28.285293Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:3bdd19be24b931df14331811f064c09caf071fd27a78c48f00bd0d644864e42c","observation_id":"808f4ef1-244a-4aa2-bfc5-0a214225c43a","resolution":{"observed_at":"2026-08-06T11:21:28.285293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:28.707945Z","title":null,"venue":null,"work_id":"3f4b075a-cec3-4448-b3dd-51b51bf76949","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:28.356097Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:6dc8f0af8339012105b86eeed0147b9798e83a54890783ff23b1d64c9eb7735c","observation_id":"afe29c0e-0c7f-47c8-9952-218ab84d364d","resolution":{"observed_at":"2026-08-06T11:21:28.775163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T11:21:07.605365Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 17 inbound Pith citation observations for arXiv:2507.22844."}