{"as_of":"2026-08-07T13:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3d5884f3911160b45b80d767f77ea18301863ce5a21858ca910cddc040c4abd","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:08:10.236337Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:49:38.226910Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T18:40:03.168966Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2601.04809","last_updated":"2026-05-04T13:55:24Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T10:42:04Z","title":"SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T16:24:04.132572Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2601.04809"},"observation_digest":"sha256:1560f9ca92d6db75eaa9e5ac53399d9a98a942911c4332e637c8bad2adb99e64","observation_id":"73b8833c-a07a-46ce-bdce-b308209207d5","resolution":{"observed_at":"2026-06-09T02:06:07.704541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-08-02T19:12:23.254065Z","title":"Yunpeng Zhai, Shuchang Tao, Cheng Chen, Anni Zou, Ziqian Chen, Qingxu Fu, Shinji Mai, Li Yu, Jiaji Deng, Zouying Cao, Zhaoyang Liu, Bolin Ding, and Jingren Zhou","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.03202","last_updated":"2026-06-01T06:25:08Z","snapshot_observed_at":"2026-08-02T19:12:22.284199Z","submitted_at":"2026-03-03T17:55:10Z","title":"Code2Math: Can Your Code Agent Effectively Evolve Math Problems Through Exploration?","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T19:12:23.254065Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2603.03202"},"observation_digest":"sha256:cb3a045c7c064dbf5d2e1d94476776979802711c98aa0788bad7a7c81b9931e9","observation_id":"c38355a6-2f37-4df5-b1ea-47e7e3e27f18","resolution":{"observed_at":"2026-08-02T19:12:23.254065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2603.15432","last_updated":"2026-04-08T15:52:59Z","snapshot_observed_at":"2026-07-31T12:22:36.137299Z","submitted_at":"2026-03-16T15:37:07Z","title":"Gym-V: A Unified Vision Environment System for Agentic Vision Research","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T10:05:09.049846Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2603.15432"},"observation_digest":"sha256:37d73eb6391ef1d496e15479923b98dc2a9b831b4070ee399f28376aafec38df","observation_id":"1a62abc8-ae43-41e0-a18b-09106001c2f1","resolution":{"observed_at":"2026-06-09T02:06:07.704541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T15:08:53.731480Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:2b4bec80b89fa5505b4143dc48587b5afe7450fe043f90f1564e9c47a21aa8f5","observation_id":"54ad51cf-ae04-47f6-bc8b-ee32a8f4f506","resolution":{"observed_at":"2026-06-09T02:06:07.704541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T00:48:54.797750Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:65de9b4367fdb6b8cba994c4e43db677c79df4df12c7cde872de92bf6fb6189e","observation_id":"d762091a-30e5-4ab7-b095-96ba5a8a2c6e","resolution":{"observed_at":"2026-07-01T00:55:12.135512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-04T22:00:35.849220Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":222,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:5a2954d29f653268816fffea0ab5e15c790b0a76255f24c3e8015ef359bb4650","observation_id":"5141a38d-f1c6-4c9f-bf84-84ca7f3dad6a","resolution":{"observed_at":"2026-06-09T02:06:07.704541Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2605.11680","last_updated":"2026-05-12T07:39:00Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:39:00Z","title":"ShapeCodeBench: A Renewable Benchmark for Perception-to-Program Reconstruction of Synthetic Shape Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:04.708277Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2605.11680"},"observation_digest":"sha256:bc883a4dacdc13d13d2bd90efffdc948a1ca53cdca95418fc0dfd21389fc2cfa","observation_id":"34638b7f-9db4-4b4f-a216-9f243aa5a349","resolution":{"observed_at":"2026-06-09T02:06:07.704541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:739a0534c65cd9782f803bd0d4678cd8c04c3be252c80b240d3cfd6e35515be4","observation_id":"a31563ec-0660-463c-bd50-6a643bd37c69","resolution":{"observed_at":"2026-06-30T21:05:04.654889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2606.01599","last_updated":"2026-06-01T02:52:49Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T02:52:49Z","title":"TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T14:55:07.045625Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2606.01599"},"observation_digest":"sha256:d8a9e2573ae376244c37f99c7980594c83cd549bfe8fd66f35dfe7056152c851","observation_id":"def3f0a8-eae3-476a-8705-e4276688909e","resolution":{"observed_at":"2026-07-01T22:56:19.981261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-02T21:19:39.471703Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:ded2b7eab9aedc712739ca7c7408685491f8f6622fea25fbbc1d55292cc556dd","observation_id":"1f8654e5-305c-46fe-9781-a682b495bb4e","resolution":{"observed_at":"2026-07-02T02:56:29.080522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":263,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:6e96498a9bec6a0fe12d4a90b8e7ab995a43ef0a9817b2b60ef624848980efde","observation_id":"c9047f27-7620-46b8-acb0-88b701d01ba7","resolution":{"observed_at":"2026-07-04T18:40:03.170224Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":263,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:6770c4c86967a12c88f4cab2005c824ac53dabccabe4b3541f3f16184659338c","observation_id":"9fafa30a-1157-4851-84e3-bfeb04c14e04","resolution":{"observed_at":"2026-07-01T18:15:59.080655Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2606.26122","last_updated":"2026-05-27T21:21:42Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T21:21:42Z","title":"DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T12:50:16.625077Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2606.26122"},"observation_digest":"sha256:fb53295a597dafc5b00db2264385bafe2a17f76231aff54ad897f63a1ce29dd6","observation_id":"b9405cd7-b621-4d4b-aa7d-e2fa6c9684ed","resolution":{"observed_at":"2026-06-29T12:53:26.544967Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2606.27369","last_updated":"2026-06-25T17:59:36Z","snapshot_observed_at":"2026-08-03T05:17:54.539513Z","submitted_at":"2026-06-25T17:59:36Z","title":"Reinforcement Learning without Ground-Truth Solutions can Improve LLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-26T04:47:47.691913Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2606.27369"},"observation_digest":"sha256:7e3efd64ea6e3d67ecb48503201c68ed6be5f10c59abdeb82f04b81a76bfb49d","observation_id":"55d954bc-7085-45db-83f6-904ce94409e6","resolution":{"observed_at":"2026-07-04T13:59:51.886210Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-14T08:30:39.248762Z","title":"EEE MMM dd HH:mm:ss z yyyy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10891","last_updated":"2026-07-12T19:40:27Z","snapshot_observed_at":"2026-08-02T15:45:32.411241Z","submitted_at":"2026-07-12T19:40:27Z","title":"SETA: Scaling Environments for Terminal Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T08:30:39.248762Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2607.10891"},"observation_digest":"sha256:fe0695d717dff0d362b7ec9db4cb1b9503412b28935ed1efa2daf25c023c5d72","observation_id":"88541c9e-7c6b-43db-ac95-2fa12382a28d","resolution":{"observed_at":"2026-07-14T08:30:39.248762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-08-01T09:52:10.993520Z","title":"arXiv preprint arXiv:2511.07317 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":232,"source":"arxiv_source","source_observed_at":"2026-08-01T09:52:10.993520Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:f70ea33029cb15804e6fa09a78d631f5ef3ca24855fb9d694eaa118e8ac890c0","observation_id":"7d008aa5-dedb-4519-bd8b-fe0a4c2c5431","resolution":{"observed_at":"2026-08-01T09:52:10.993520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-08-05T16:49:38.226910Z","title":"Dazhi Zhan, Xin Liu, Wei Bai, Wei Li, Shize Guo, and Zhisong Pan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03571","last_updated":"2026-08-06T02:46:18Z","snapshot_observed_at":"2026-08-07T11:57:25.299271Z","submitted_at":"2026-08-04T12:32:18Z","title":"Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:49:38.226910Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2608.03571"},"observation_digest":"sha256:d49b3804c6d4b1ed8c37169c4d8dd9c43340856b7c63183d474e52ff1de3a383","observation_id":"03046ac1-6a00-4528-a8a9-70b08d86f949","resolution":{"observed_at":"2026-08-05T16:49:38.226910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.07317/citation-record","integrity":"/paper/2511.07317/integrity","json":"/paper/2511.07317/citation-record.json","paper":"/paper/2511.07317"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:04.359917Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.359917Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:b4810b29b3e5eea209f5ce47a2dd8033b6f567fd35682e54efbfc05fd67de649","observation_id":"711a9378-d43d-44ae-85ac-9eaee17f53f4","resolution":{"observed_at":"2026-08-03T23:08:04.359917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:04.445615Z","title":"Aime problems and solutions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.445615Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:d825ad6b2a66c0f573f5da67f947724f45940b4dc120aa3a95e3064a7ad8786c","observation_id":"41507d03-bcbb-42eb-bab7-f069ab16b6ad","resolution":{"observed_at":"2026-08-03T23:08:04.445615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:04.518494Z","title":"M., Wu, Y., Powell, G., McGrew, B., and Mordatch, I","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.518494Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:bb8a513bd429a11fc0218197ec71555fe52c462491cb0a30773ff7199be0b1fa","observation_id":"7c049207-1df0-446a-aa0e-d0a5684a3135","resolution":{"observed_at":"2026-08-03T23:08:04.518494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19914","last_updated":"2025-06-09T07:49:32Z","snapshot_observed_at":"2026-07-06T21:30:37.657153Z","submitted_at":"2025-05-26T12:40:31Z","title":"Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19914","snapshot_observed_at":"2026-08-03T23:08:04.572067Z","title":"Enigmata: Scaling logical reasoning in large language models with synthetic verifiable puzzles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.572067Z"},"links":{"cited_paper":"/paper/2505.19914","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:623922d1285cfcccf2e1f6b05bd3eb6ba0493ba0f96cddf3e99aa6f16ade442a","observation_id":"d0f403d2-1bb2-4db0-a725-8eeb63a00929","resolution":{"observed_at":"2026-08-03T23:08:04.572067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:04.630272Z","title":"Self-evolving curriculum for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.630272Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:4fbccd7a26d205023ecbeb4c07934162a0600d0acdd66cc872be9fb174dca8dd","observation_id":"b04e6ac3-fb27-4529-a655-615ad5de2d78","resolution":{"observed_at":"2026-08-03T23:08:04.630272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:04.748584Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.748584Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:81d6931f521ee367cc26e205979d93125f8e72ef73a4d06e99ff87fc800bc781","observation_id":"c29c4463-2279-4cd2-901a-de145fdfcccd","resolution":{"observed_at":"2026-08-03T23:08:04.748584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:04.802059Z","title":null,"venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.802059Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:ad5ed4a00290fbd79363afd709502ba7b7766fa05d2cbe4a06bd107c01732a5e","observation_id":"9535e49d-2159-455a-a9de-101bbf0ad069","resolution":{"observed_at":"2026-08-03T23:08:04.802059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-03T23:08:04.849138Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.849138Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:1ac524f847a8ab5e1e4d49679d072f65c8b1a2630850d9870b26b260d6e7be1e","observation_id":"c0ebb816-2aed-4d66-8ac4-8c34f78ff225","resolution":{"observed_at":"2026-08-03T23:08:04.849138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:04.933968Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:04.933968Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:a9c0b0b92f5c8981896dac2eba8f21bef880312ec3ac61356f188e89f0d93c42","observation_id":"b4f9eeb1-52fa-43cf-84bf-786875497883","resolution":{"observed_at":"2026-08-03T23:08:04.933968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:05.021984Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.021984Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:f0b893f0ce04a4dddac1355392bddc5b11ea5421114d27430f97c64020b7121f","observation_id":"83c99156-8ba9-4c91-aa52-838e1cac10e4","resolution":{"observed_at":"2026-08-03T23:08:05.021984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:05.083453Z","title":"Y., and Tan, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.083453Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:0d80728f193e8e9ef97c9a53f7c23a74096c172c9e2e3872ef724cc4510da853","observation_id":"dd6500fe-364f-47cb-a18f-034c9a757fcd","resolution":{"observed_at":"2026-08-03T23:08:05.083453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:05.189419Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.189419Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:f30fc5e0ffa444a17f295c5f62db8e35d35d6e6820a49b73ad8c0cc0d090f2d1","observation_id":"b88fc6d6-9a7c-4967-99de-c508fd59c761","resolution":{"observed_at":"2026-08-03T23:08:05.189419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-03T23:08:05.247460Z","title":"Glm-4.5: Agentic, reasoning, and coding (arc) foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.247460Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:07104dab6ac8d6e62adb273643b559e4c2b9cb1250fed3789f7097855034d0da","observation_id":"6241cec8-4ab9-4249-ac86-d3ee2cc9e701","resolution":{"observed_at":"2026-08-03T23:08:05.247460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T23:08:05.337250Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.337250Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:6f89d58fd130dcf00605f5dc57b7ad52d29f06b503fd0b32c3e7c0c2fc1422a9","observation_id":"bfe257a2-376d-4514-a611-19c0b2631ef3","resolution":{"observed_at":"2026-08-03T23:08:05.337250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-03T02:41:13.331563Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-03T23:08:05.394862Z","title":"K., Marten, R., Keh, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.394862Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:303917d6f871b07d0c1207dbdee12e8ab8910e6a4a988308aa13069aa7979163","observation_id":"63845372-c90a-463d-83d9-a1ae4dedb9cb","resolution":{"observed_at":"2026-08-03T23:08:05.394862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:05.472364Z","title":"L., Shen, J., Hu, J., Han, X., Huang, Y., Zhang, Y., Liu, J., Qi, L., Liu, Z., and Sun, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.472364Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:36acad459daf49c6b2f576d5170d95cd804af75781e691c11fc7f039c5db0fbf","observation_id":"c0722e1e-dee5-4d8b-9c9c-7859f02264a0","resolution":{"observed_at":"2026-08-03T23:08:05.472364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-03T23:08:05.560042Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.560042Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:d500d2d9848f50cff762c1bda382e393598944c33412ee3929f2fe88d46006ed","observation_id":"7eff8bab-4ce0-4f8b-b813-c430af938f21","resolution":{"observed_at":"2026-08-03T23:08:05.560042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-03T23:08:05.673978Z","title":"K., Zhu, Z., Wang, W., Jiang, S., Wang, H., Chen, H., Chen, B., Fang, W., Xianyu, Cao, Y., Xu, H., and Liu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.673978Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:9d10b2682981bd3a3a9cc78f14f810e1328c8d45cea6148c6e3b63b15bfcffb7","observation_id":"5ba791f7-8638-45e5-ba25-680772fc0b65","resolution":{"observed_at":"2026-08-03T23:08:05.673978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:05.744103Z","title":"Prorl v2: Prolonged training validates rl scaling laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.744103Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:daf3c2f7a0d8a713d3caea4b17aedc7cf160035524e77a430850b09dbb0f4bfa","observation_id":"42f9225f-c8f4-4bc3-837a-6100450466b2","resolution":{"observed_at":"2026-08-03T23:08:05.744103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:05.823057Z","title":"Brorl: Scaling reinforcement learning via broadened exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.823057Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:0413a585f7a0dc85c81bd08a7508d676c2d70115c8c55ff183c0f49b23e1072f","observation_id":"54ca0bb3-93fc-4c14-aab0-4a2359dd51bb","resolution":{"observed_at":"2026-08-03T23:08:05.823057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10554","last_updated":"2025-05-27T17:41:22Z","snapshot_observed_at":"2026-07-06T21:24:34.845524Z","submitted_at":"2025-05-15T17:58:33Z","title":"Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10554","snapshot_observed_at":"2026-08-03T23:08:05.895267Z","title":"Beyond'aha!': Toward systematic meta-abilities alignment in large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.895267Z"},"links":{"cited_paper":"/paper/2505.10554","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:4f97e7b6380c937cd0075370400054a391da680a1dbaa1297703e295e4446a9e","observation_id":"38fba38e-0463-4c0c-82b2-238b28506783","resolution":{"observed_at":"2026-08-03T23:08:05.895267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:05.978760Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:05.978760Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:01d77a552ff82c62803d210f95f75d55dc96809561c88cdb04377b25a9282e07","observation_id":"68b9e502-9711-4063-87ce-6832ab832e08","resolution":{"observed_at":"2026-08-03T23:08:05.978760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:06.061589Z","title":"Prioritized level replay","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.061589Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:8ff75e228d26883db5e3b4b8b4d39fe94369c30d12d26fee03407c7892ac050a","observation_id":"b1b10ddd-5362-49f6-9954-0259c47ac4f9","resolution":{"observed_at":"2026-08-03T23:08:06.061589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:06.138272Z","title":null,"venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.138272Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:35425a4639eb1ed5ff8fe05c30ce738764dd160bc4d4b620450a7863f250a3f3","observation_id":"59a2cb9f-857c-4e43-8d08-a06b88f9b181","resolution":{"observed_at":"2026-08-03T23:08:06.138272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:06.221024Z","title":"V., Jain, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.221024Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:adf820dec2bbfc52a7df99b64eecdb023c9846686b59bcf37c3199d94066bb81","observation_id":"c9b3361c-8da1-4f76-9532-371b05ce2414","resolution":{"observed_at":"2026-08-03T23:08:06.221024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-03T23:08:06.327269Z","title":"S., Zaheer, M., Dhillon, I","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.327269Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:e76a6ac84baa0d814ea99415eefe1c2678f20a91b1d9193016930a2ccd327e7b","observation_id":"7132b63c-3286-4b58-8493-a9a9e8218e2f","resolution":{"observed_at":"2026-08-03T23:08:06.327269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-03T23:08:06.409104Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.409104Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:af79e6fd75f9c47578a8f26469764b4c1a00010d2701d6ebbf3ad57da95fa5a7","observation_id":"b1bbae63-0a3f-429b-b99a-05baa91c1571","resolution":{"observed_at":"2026-08-03T23:08:06.409104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-03T23:08:06.494187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.494187Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:98635305d4e8eb63c19f72942049e41d4a3341b515f55903a4ebb999908e5151","observation_id":"b0dc3d5f-5cf6-4b9b-ba7f-6fd593e0749e","resolution":{"observed_at":"2026-08-03T23:08:06.494187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:06.605289Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.605289Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:b44d14d0f319cbeb8f653c2a442235be230d397a6a26ce80e5904fc07bec5b74","observation_id":"84a955eb-c0bc-432a-89c3-a50398bfaba5","resolution":{"observed_at":"2026-08-03T23:08:06.605289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02930","last_updated":"2024-08-06T03:26:01Z","snapshot_observed_at":"2026-07-06T18:57:18.298332Z","submitted_at":"2024-08-06T03:26:01Z","title":"The Need for a Big World Simulator: A Scientific Challenge for Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02930","snapshot_observed_at":"2026-08-03T23:08:06.689110Z","title":"J., Lewandowski, A., and Van Roy, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.689110Z"},"links":{"cited_paper":"/paper/2408.02930","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:bb348734a31b81a0b92c9ee99c1c3fd28efda1e19c9f970066fbc3af5083bf5f","observation_id":"8b87b70c-90e3-459e-ad40-839f969c78e5","resolution":{"observed_at":"2026-08-03T23:08:06.689110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:06.771218Z","title":"D., Pyatkin, V., Huang, S., Ivison, H., Brahman, F., Miranda, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.771218Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:55e2161edc2c49b22d8bd24b5dce837afdc876f793c3d94c2a67fa24e1b727c8","observation_id":"0c65452e-c59e-4c8d-a26f-34f68ec3cdec","resolution":{"observed_at":"2026-08-03T23:08:06.771218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08636","last_updated":"2026-05-20T08:06:05Z","snapshot_observed_at":"2026-08-04T03:35:42.053775Z","submitted_at":"2025-08-12T05:00:00Z","title":"InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08636","snapshot_observed_at":"2026-08-03T23:08:06.836334Z","title":"Internbootcamp technical report: Boosting llm reasoning with verifiable task scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.836334Z"},"links":{"cited_paper":"/paper/2508.08636","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:8f85f37cd669a640d071e4f923cd5897ce8466642512a10244346fc4f7006f8f","observation_id":"0c8e6dbc-9ba9-4cfc-b8db-a4b698fc7381","resolution":{"observed_at":"2026-08-03T23:08:06.836334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:06.902982Z","title":"S., and Jaques, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:06.902982Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:67ca7aebd70a73499d37853f09d87d77ab715d1379d515aefff870c4a697b987","observation_id":"ca4b7185-7809-4763-8279-75bd5f975fb0","resolution":{"observed_at":"2026-08-03T23:08:06.902982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:07.071246Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.071246Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:5b79b5dc9d6acb37177234425185f1cf7a1473ad9491bff76cb8c9b15bf359a8","observation_id":"eb63c31e-e793-413c-b0f4-ef3d588965c7","resolution":{"observed_at":"2026-08-03T23:08:07.071246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:07.185149Z","title":"Saturn: Sat-based reinforcement learning to unleash language model reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.185149Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:285740763634e05e4c883f28ec46ceff5397c34f1ca4967c1da90cffd2839b05","observation_id":"75ec6c54-8332-439a-acf0-24e5e12fed8c","resolution":{"observed_at":"2026-08-03T23:08:07.185149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:07.393807Z","title":"Synlogic: Synthesizing verifiable reasoning data at scale for learning logical reasoning and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.393807Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:3fe8bafdc6d7c27bb2775ff427f0be90e19222becb693d032d989cade0b949d5","observation_id":"e2683b59-d82d-4645-8929-4126cc34d343","resolution":{"observed_at":"2026-08-03T23:08:07.393807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-03T23:08:07.481047Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.481047Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:d72c99878c672f3f770409201e1927ef6d211abf61c2d9fa36c78ef99b74f4a3","observation_id":"f8b28bf1-c0ac-4f36-805a-8d86fc864981","resolution":{"observed_at":"2026-08-03T23:08:07.481047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:07.569271Z","title":"Y., Roongta, M., Cai, C., Luo, J., Li, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.569271Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:37d81f3abb563d2fa18dd0e77186856ac24e3ca2bd891b7a690ec0f0660626de","observation_id":"bb1abdb8-287c-4a71-9ec2-a779e459fed4","resolution":{"observed_at":"2026-08-03T23:08:07.569271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-03T23:08:07.683868Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.683868Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:37245c770d877c7d4d292da0def8a4c8ae13e7b849d9f167c68f6c4bc486829d","observation_id":"9f0efe4a-2ac9-4b6e-b7b6-fc352bbd9358","resolution":{"observed_at":"2026-08-03T23:08:07.683868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:07.806197Z","title":"Deep research system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.806197Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:726aa17f8f3f9ab0d0aa80ac3150c97e0ebd61194a7282ea5370bbd83813138f","observation_id":"500fd292-5a3c-466b-b6e0-e7e7133f8384","resolution":{"observed_at":"2026-08-03T23:08:07.806197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:07.929035Z","title":"L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:07.929035Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:555cbdaa4f08b875bf2d3a78db6e5cffee8b7148390c86de7bec0841c1c664a8","observation_id":"a58544e5-1854-424d-9ed9-b49781722c25","resolution":{"observed_at":"2026-08-03T23:08:07.929035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:08.053532Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.053532Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:c9341d1cdf16ff924a4267b1543d5b8cd330b9aeda3d432f8650bb2abeaac218","observation_id":"12d60c90-3bd8-4418-8b28-8628cd7c5e9d","resolution":{"observed_at":"2026-08-03T23:08:08.053532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:08.135012Z","title":"Automatic curriculum learning for deep rl: A short survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.135012Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:47307f4b6403f17d1c77cd4075badf2a778a1ac523b8daa3fb4b95bdc1d27de2","observation_id":"76dc2670-35e2-4c5b-b56d-266d55562eb5","resolution":{"observed_at":"2026-08-03T23:08:08.135012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T23:08:08.255858Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.255858Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:088faf8cd84e692001ca124557045225082cef9e8afac6083ca4d9b9b45daf15","observation_id":"181a8df9-d81f-457a-96c0-fecd3eda50ff","resolution":{"observed_at":"2026-08-03T23:08:08.255858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T23:08:08.418042Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.418042Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:49c7d7cc5befc5023965978612ab9c17811103692f3100c95358644b5a848764","observation_id":"dfdb21fd-fd72-49dc-99d0-2698d935ad28","resolution":{"observed_at":"2026-08-03T23:08:08.418042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:08.537091Z","title":"M., and Littwin, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.537091Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:4a4c14be31d2f92453cc2cbe4d0afb1c49a0b59a67a60a451926697a8536147b","observation_id":"34c31c20-9cfa-44c2-b1d6-5420b9cae465","resolution":{"observed_at":"2026-08-03T23:08:08.537091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:08.623207Z","title":"D., and Arora, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.623207Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:60fc920a596b86cd7601642d18ad1afdd60241d4da834dcb0695034dd9b6dee8","observation_id":"5608e14a-e46e-4d74-8c30-9b628f50b09c","resolution":{"observed_at":"2026-08-03T23:08:08.623207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T23:08:08.747991Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.747991Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:18e8e80cf2b2b7e90553b50fecac31bf88624e1dd78cfa0a35f7210e1b82a104","observation_id":"40eaaeff-fdc9-462d-ad16-c0d6842b87f3","resolution":{"observed_at":"2026-08-03T23:08:08.747991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-07-06T21:05:44.765030Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-03T23:08:08.872364Z","title":"Efficient reinforcement finetuning via adaptive curriculum learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.872364Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:94cd2182fdef2478c179ae883145d6256f62134fab95be76fcdb8046f2baf445","observation_id":"315a5eb3-8e26-4444-9d11-3368db7147eb","resolution":{"observed_at":"2026-08-03T23:08:08.872364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:08.957659Z","title":"Reasoning gym: Reasoning environments for reinforcement learning with verifiable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:08.957659Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:8736d0302a763dcfa581a0cf84e50feb303e6c328f5c0f55be3542d3aa92bef5","observation_id":"ece12c58-8a02-44be-a5bd-3f495b3650a7","resolution":{"observed_at":"2026-08-03T23:08:08.957659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:09.054674Z","title":"A., Zettlemoyer, L., and Yu, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.054674Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:7ff08cd3ab60bfeb215f50124eee30a6671f793cea370709be0ddd3bdd89436e","observation_id":"cde4d9cd-cad7-49f7-9f5a-6b546170dfe9","resolution":{"observed_at":"2026-08-03T23:08:09.054674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18880","last_updated":"2025-06-23T17:51:40Z","snapshot_observed_at":"2026-08-06T23:12:46.021492Z","submitted_at":"2025-06-23T17:51:40Z","title":"OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18880","snapshot_observed_at":"2026-08-03T23:08:09.137256Z","title":"Omega: Can llms reason outside the box in math? evaluating exploratory, compositional, and transformative generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.137256Z"},"links":{"cited_paper":"/paper/2506.18880","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:3873d868d1887bcec9296645204edb2d1bdc2815f8aa09060d791c0009c8a5f0","observation_id":"ff53744e-1a34-46c0-a3cf-94671faf3c08","resolution":{"observed_at":"2026-08-03T23:08:09.137256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.01753","last_updated":"2019-02-21T01:17:31Z","snapshot_observed_at":"2026-08-02T23:13:12.652289Z","submitted_at":"2019-01-07T11:28:36Z","title":"Paired Open-Ended Trailblazer (POET): Endlessly Generating Increasingly Complex and Diverse Learning Environments and Their Solutions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.01753","snapshot_observed_at":"2026-08-03T23:08:09.253737Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.253737Z"},"links":{"cited_paper":"/paper/1901.01753","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:cf3ed5b29a774731e416d050957daa3605d2295176a7bfe5424b818aafa73480","observation_id":"a106d9d0-8c57-4f76-89e9-cca574c655b8","resolution":{"observed_at":"2026-08-03T23:08:09.253737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:09.362784Z","title":"S., Arunkumar, A., Stap, D., Pathak, E., Karamanolakis, G., Lai, H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.362784Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:e0751c2fb553d6bd0c798c30d0a535332036c313c3d1af9a30cf255dfe16bedd","observation_id":"1cd2ef87-67bb-48cf-9a7e-6e047fbd4d9b","resolution":{"observed_at":"2026-08-03T23:08:09.362784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:09.480977Z","title":"A., Khashabi, D., and Hajishirzi, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.480977Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:8ae830ae8290010b518e2be55886df2f9b4cea3139dc9ae0047902713484680f","observation_id":"0f352196-bd35-47c5-9741-09d84abd32fc","resolution":{"observed_at":"2026-08-03T23:08:09.480977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23123","last_updated":"2025-03-04T06:22:40Z","snapshot_observed_at":"2026-07-06T19:42:21.306600Z","submitted_at":"2024-10-30T15:31:54Z","title":"On Memorization of Large Language Models in Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23123","snapshot_observed_at":"2026-08-03T23:08:09.608509Z","title":"Y., Li, B., Ghazi, B., and Kumar, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.608509Z"},"links":{"cited_paper":"/paper/2410.23123","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:53ae27844072361c67a48da3b0d119486ae14803da1729d9ddbd5e69db579fe1","observation_id":"e2b3afbe-65f8-42f1-941a-0635d7f30ff1","resolution":{"observed_at":"2026-08-03T23:08:09.608509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:09.724972Z","title":"Your efficient rl framework secretly brings you off-policy rl training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.724972Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:841e6f5dbb63af95e6d2829292f4ae6f84dc8822088c6cb850c213b805adede2","observation_id":"fc43979e-56b5-47c1-857e-606e250eaff7","resolution":{"observed_at":"2026-08-03T23:08:09.724972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T23:08:09.847499Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.847499Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:2d514d579414354c88dfb9543c47551510f3ddf982296f90beb2e21b4caa022d","observation_id":"32b4327d-65f7-4ff6-a194-9c1365e4c8fc","resolution":{"observed_at":"2026-08-03T23:08:09.847499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:09.963111Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:09.963111Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:de2509ef3a3e3fa928f0bff9aae6aadc5d598a6db17fb4517ea2594902df9f7d","observation_id":"c1794073-6282-49e4-814f-6ae36e646daf","resolution":{"observed_at":"2026-08-03T23:08:09.963111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:10.022415Z","title":"Absolute zero: Reinforced self-play reasoning with zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:10.022415Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:0c0751e1e9b9ea3cc6dca40090a56448b4a609db43b9b84076cd057bf10612f1","observation_id":"8cd0af95-2e55-49a1-8e49-7722f2dc7d11","resolution":{"observed_at":"2026-08-03T23:08:10.022415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:10.134897Z","title":"H., Cao, S., Kozyrakis, C., Stoica, I., Gonzalez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:10.134897Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:0da3faa60ea4b12aeb18eae512b7ee0fa3801549bfaade398475065ecfb16a43","observation_id":"ce03bf9c-b9ee-4b57-b1a2-cd0e63d90554","resolution":{"observed_at":"2026-08-03T23:08:10.134897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:08:10.236337Z","title":"APRIL: active partial rollouts in reinforcement learning to tame long-tail generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T23:08:10.236337Z"},"links":{"citing_paper":"/paper/2511.07317"},"observation_digest":"sha256:28d30a08e14c34ebcd704c1ba83de71a4a4fa999ef9f346498e855b436e7bd0d","observation_id":"316f22f8-a7ad-42db-9f99-f2ee44fe808d","resolution":{"observed_at":"2026-08-03T23:08:10.236337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 17 inbound Pith citation observations for arXiv:2511.07317."}