{"as_of":"2026-08-07T12:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f5dc70dc6e8ae1ea90b234a7b673d95d220aa67ff5566e71a4e1a145f22a874","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:33.099054Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:16:05.122488Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:29:45.796847Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-06T11:16:05.122488Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22879","last_updated":"2025-07-31T16:54:43Z","snapshot_observed_at":"2026-08-06T11:16:02.241906Z","submitted_at":"2025-07-30T17:55:06Z","title":"RecGPT Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:05.122488Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2507.22879"},"observation_digest":"sha256:19350237c7996f35da785a231f8f62ccf4836e5bf28d92941fa469d84802ef8b","observation_id":"c1576350-4c9a-4f54-bcae-7fcecb8cd1d3","resolution":{"observed_at":"2026-08-06T11:16:05.122488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-06T04:17:55.008086Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:55.008086Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:3153566554aef3fed1900dd918dee1a32447d6efd8f0bd73b1d876e9f45b40f8","observation_id":"897f391b-d021-49bd-bf3a-e1519725b756","resolution":{"observed_at":"2026-08-06T04:17:55.008086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-04T16:07:42.401654Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:42.401654Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:6c72e43b2c7d08b9ea16317316476382d177fe5f47a115010759dd929e4ebcfd","observation_id":"301f3916-28be-482d-97d3-d72a57f8f99b","resolution":{"observed_at":"2026-08-04T16:07:42.401654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2510.07972","last_updated":"2026-04-13T14:08:13Z","snapshot_observed_at":"2026-08-06T02:37:16.242841Z","submitted_at":"2025-10-09T09:03:15Z","title":"SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T09:33:57.037949Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2510.07972"},"observation_digest":"sha256:35ea726e3c9c5971471eba371640ad44a0faf4bc66df35e2fcb5fe30a0b0ed37","observation_id":"ad7c4fc5-127c-4d41-af37-1e097e952e77","resolution":{"observed_at":"2026-05-18T09:36:11.236206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-04T10:53:09.781696Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:09.781696Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:0d836a5d0efa8a5d41e6df7ecc25a147d9ef3afbc73494e7b9df5d5b253e4bf8","observation_id":"ff131638-77fc-41eb-bd47-63dfda5b131e","resolution":{"observed_at":"2026-08-04T10:53:09.781696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2510.11122","last_updated":"2026-04-04T06:08:34Z","snapshot_observed_at":"2026-08-06T00:49:59.952705Z","submitted_at":"2025-10-13T08:08:59Z","title":"Learning to Trust: Dynamic Utilization of Retrieval-Augmented Generation for E-commerce Search Relevance","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T08:06:23.479875Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2510.11122"},"observation_digest":"sha256:e67e67459e1a2c6f701d7b3580645a414baba2cea06e1376aaeae8e85214116e","observation_id":"72950ae2-769d-4d8a-b64a-9ff5eaac8337","resolution":{"observed_at":"2026-05-18T08:11:07.151719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-04T09:48:09.807998Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13554","last_updated":"2026-06-08T06:02:10Z","snapshot_observed_at":"2026-08-04T09:47:55.188440Z","submitted_at":"2025-10-15T13:49:51Z","title":"Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T09:48:09.807998Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2510.13554"},"observation_digest":"sha256:b78021bcae603f720c7923c5c175d693bc5ffbd92b52858752812fe8f7ca6cd1","observation_id":"b00c5174-590a-4584-aaa1-0aed4cf90aa2","resolution":{"observed_at":"2026-08-04T09:48:09.807998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T20:38:30.169363Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2511.14617"},"observation_digest":"sha256:287996a2702ee6fdbb32c09a2d817a80adb952ae5b9ae1665465eaf97a9f38b2","observation_id":"36e7d6b3-f6d2-4b37-bd48-56e3bb42f980","resolution":{"observed_at":"2026-05-17T20:40:14.531558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2511.17652","last_updated":"2026-04-06T19:52:36Z","snapshot_observed_at":"2026-08-01T03:53:15.171510Z","submitted_at":"2025-11-20T13:29:35Z","title":"TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T20:29:39.744103Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2511.17652"},"observation_digest":"sha256:085a3147a9ea1fba42b9206720c8893372a09e5ab9700aa63781414b2413300e","observation_id":"e0190bf3-ac8c-4976-b820-cf6851901b3d","resolution":{"observed_at":"2026-05-17T20:30:11.134883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2601.05808","last_updated":"2026-04-17T17:24:06Z","snapshot_observed_at":"2026-08-02T19:53:18.484273Z","submitted_at":"2026-01-09T14:32:06Z","title":"EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T16:05:32.355446Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2601.05808"},"observation_digest":"sha256:cdbdf7653ccb40ea9d4d9171b117763c4ecff50c259bd99e48be48ad930a6f72","observation_id":"a677679c-d9c2-4e32-9af5-1c0ba159a767","resolution":{"observed_at":"2026-05-16T16:08:04.507306Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-04T06:25:53.985066Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-06T23:30:39.270704Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:53.985066Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:a686f8af2bd1499a5911832a0bfe86459cca2a8a878a4d7d7fa30aabf985a18d","observation_id":"1acb3228-e099-4eb7-9fee-cabf3f8bd5a7","resolution":{"observed_at":"2026-08-04T06:25:53.985066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2601.18150","last_updated":"2026-04-10T15:41:56Z","snapshot_observed_at":"2026-08-02T16:35:13.446446Z","submitted_at":"2026-01-26T05:12:05Z","title":"FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T11:07:18.839899Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2601.18150"},"observation_digest":"sha256:3b3b389972a54cf5f35ce3ef8d454cf7027828cfa1f44fef9ded39b55517b1d5","observation_id":"a890e8d4-eb8d-409d-8cd3-39bcc6009c17","resolution":{"observed_at":"2026-05-16T11:07:47.084927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2602.01970","last_updated":"2026-05-15T12:23:06Z","snapshot_observed_at":"2026-07-06T22:44:04.951815Z","submitted_at":"2026-02-02T11:24:36Z","title":"Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T14:09:26.842696Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2602.01970"},"observation_digest":"sha256:b44c221858e7c5b394b12caba88f7b64226d8205e13b3034ed1a4a3072d81d70","observation_id":"54e0a443-0b89-41c7-81af-a6060d84df1e","resolution":{"observed_at":"2026-05-21T14:10:13.042955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:1044108361e50f1cb9e23d0f6e97250272f98885020d571caa3717b2afa4dbe4","observation_id":"1d08131e-bc68-4cac-8b13-e6311204bd50","resolution":{"observed_at":"2026-05-13T20:28:14.103827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-07-06T22:59:54.573362Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:ed930bcec663b0a1c23ba095def598a4b03e93fcd3283696fb482f5c3be6bb6c","observation_id":"3a2c3f59-b823-4fc0-9825-6df5dccc7e83","resolution":{"observed_at":"2026-05-11T09:16:03.246392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2604.16893","last_updated":"2026-04-18T07:56:32Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T07:56:32Z","title":"EasyVideoR1: Easier RL for Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T07:41:27.231098Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2604.16893"},"observation_digest":"sha256:6eb45ffd751fb7634fda1527544525226b862282f4d8e67a11cda1188d4117b3","observation_id":"a2a9e41c-0119-478c-b58c-56dc4825aef2","resolution":{"observed_at":"2026-05-10T07:42:06.689947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2604.16918","last_updated":"2026-04-18T08:51:29Z","snapshot_observed_at":"2026-08-03T04:30:53.769713Z","submitted_at":"2026-04-18T08:51:29Z","title":"Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T07:27:15.270996Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2604.16918"},"observation_digest":"sha256:4b60ffeaa6c8c8aa3733a2235522c62c41c023b92f9e91cba9b923962419df73","observation_id":"99dfa058-3c03-46c6-8b34-8c311883effb","resolution":{"observed_at":"2026-05-10T07:52:14.069720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2604.23838","last_updated":"2026-04-26T18:45:31Z","snapshot_observed_at":"2026-08-02T18:30:10.398959Z","submitted_at":"2026-04-26T18:45:31Z","title":"JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T06:36:33.914193Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2604.23838"},"observation_digest":"sha256:836e9a4ff755bfa8f521846f194d55c8134ad161bfa50623b81ad2c990c28d6f","observation_id":"b1a486e4-e265-4b14-9808-e213a9aecbd7","resolution":{"observed_at":"2026-05-11T21:11:11.139120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:ac6f572b780183395cc56d2e2a8cc9f1f8d65d27b2ff8aeb07617b233460c83e","observation_id":"a8b294fb-cc58-4de5-9569-c9d875a851aa","resolution":{"observed_at":"2026-05-11T21:31:16.305049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:94a99a0b1d34678df8cb89d46360b99764049b71890149a353b66928c524043e","observation_id":"d2f7b234-e637-4a7a-8c4c-15610da0c84e","resolution":{"observed_at":"2026-05-21T08:39:53.289906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.08766","last_updated":"2026-05-09T07:51:03Z","snapshot_observed_at":"2026-08-02T11:50:07.900845Z","submitted_at":"2026-05-09T07:51:03Z","title":"UserGPT Technical Report","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-12T03:10:51.555653Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.08766"},"observation_digest":"sha256:0ef8f4429856d83d1602596b009db36e62fa698943006dc2d9bf5520ff425e81","observation_id":"40ed7ce8-f643-4933-b370-36d34c3c9eff","resolution":{"observed_at":"2026-05-12T03:11:18.683912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:59:44.082011Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:d22de9c11916a7549a953fa478f68785fd9cb21e99e9ed8eb76e599ce55093a3","observation_id":"7a6902da-cc9d-44b4-9d2e-093d8d1a27e0","resolution":{"observed_at":"2026-05-12T05:46:27.373550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.10325","last_updated":"2026-05-27T13:12:06Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:30:53Z","title":"Verifiable Process Rewards for Agentic Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T22:43:50.317854Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.10325"},"observation_digest":"sha256:69eaa3743972e39660304dd33573791f89c18bca61c9609f31c0409bcd0b9225","observation_id":"b1f48d73-be66-4a87-b2f0-3d1e3bde7565","resolution":{"observed_at":"2026-06-30T22:45:07.266701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:6672b0faaae25126ea16a7445512d84f6eec64e88832a2c8df1b8966b5b2e711","observation_id":"f3660f3f-d005-46a3-a023-10a31f34b7e2","resolution":{"observed_at":"2026-05-13T06:02:23.534275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.20104","last_updated":"2026-05-19T16:55:48Z","snapshot_observed_at":"2026-08-04T03:30:21.702008Z","submitted_at":"2026-05-19T16:55:48Z","title":"Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T06:58:07.996335Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.20104"},"observation_digest":"sha256:dbe32df63f9fafe01f45599776745a1a2a69333be087e8960013f88203243809","observation_id":"6518ee4a-f0b2-471c-af4f-1923bffdc160","resolution":{"observed_at":"2026-05-20T07:03:06.446849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2606.03077","last_updated":"2026-06-10T06:28:18Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:09:13Z","title":"Libra: Efficient Resource Management for Agentic RL Post-Training","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:00.385932Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2606.03077"},"observation_digest":"sha256:2602f4dab7f4f1f33a503ab1042a715b6159bb8c96d635cabc3f91f693bdbea6","observation_id":"9d6eb88f-6a99-4b30-8264-ddb67750a865","resolution":{"observed_at":"2026-07-02T02:16:27.171549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2606.04155","last_updated":"2026-06-02T19:20:54Z","snapshot_observed_at":"2026-08-06T15:07:35.140479Z","submitted_at":"2026-06-02T19:20:54Z","title":"SocialCoach: Personalized Social Skill Learning with RL-based Agentic Tutoring and Practice","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T08:04:17.224987Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2606.04155"},"observation_digest":"sha256:a49caca4b5dbb08d07e3767eb69b38c2c57537ba99af9d357d7b85e8d586c7f1","observation_id":"3c641bf8-1063-4d73-a40c-366c69a3b6fc","resolution":{"observed_at":"2026-07-02T05:46:41.068185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2606.19004","last_updated":"2026-06-17T12:31:44Z","snapshot_observed_at":"2026-07-06T23:54:23.090538Z","submitted_at":"2026-06-17T12:31:44Z","title":"Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T19:06:16.100762Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2606.19004"},"observation_digest":"sha256:448ec6c634e9c994a70ae313b23fa02436ff0ba8fddd45e91dc15c6a12c96e2b","observation_id":"9bcb4746-94ca-4dfc-8ebf-c5cdb6f82076","resolution":{"observed_at":"2026-07-04T02:49:24.692270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2606.22995","last_updated":"2026-06-22T08:12:47Z","snapshot_observed_at":"2026-07-06T23:57:47.047975Z","submitted_at":"2026-06-22T08:12:47Z","title":"Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T08:44:23.085858Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2606.22995"},"observation_digest":"sha256:6f3c0cf22ff5e03e1637f266387aa24f6f794c7df164c19e4b139c7327b60daf","observation_id":"262e3738-a5e4-427d-94f9-349e4919805e","resolution":{"observed_at":"2026-07-04T10:29:45.798796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2606.29526","last_updated":"2026-06-28T17:40:02Z","snapshot_observed_at":"2026-08-02T15:21:00.457548Z","submitted_at":"2026-06-28T17:40:02Z","title":"The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T07:23:19.403334Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2606.29526"},"observation_digest":"sha256:84c5757835280fe207494b90ce2734b2dcaee37605a0322169ebe48988b6a847","observation_id":"40aadc8f-ea47-46b9-b722-25100d56df1f","resolution":{"observed_at":"2026-06-30T07:24:20.912894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2606.31693","last_updated":"2026-07-15T17:49:58Z","snapshot_observed_at":"2026-08-02T09:18:56.324957Z","submitted_at":"2026-06-30T14:05:28Z","title":"ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-01T03:56:46.899707Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2606.31693"},"observation_digest":"sha256:5b4007caf71d2de3a1270c3f669814d3e5349cc628e744ad73fe59ea85235362","observation_id":"fe389f63-900c-4705-ab04-2215ee34ba30","resolution":{"observed_at":"2026-07-01T11:45:46.883444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-02T09:19:06.709345Z","title":"Reinforcement learning optimization for large- scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.31693","last_updated":"2026-07-15T17:49:58Z","snapshot_observed_at":"2026-08-02T09:18:56.324957Z","submitted_at":"2026-06-30T14:05:28Z","title":"ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T09:19:06.709345Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2606.31693"},"observation_digest":"sha256:a87e2e760c2dec30dea074956e802b68426ed5c8590d77ec551ce7b1601c4059","observation_id":"8fde50f1-ed10-4e5f-97cc-876f04a51ffb","resolution":{"observed_at":"2026-08-02T09:19:06.709345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2506.06122 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:60cee1820d160ce0a7d08826ead3cbf19cd33b7d1c8c2c718880671ef49a611b","observation_id":"cc362501-73a8-4172-b17c-eddfad69ac7d","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-13T04:42:35.589143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09207","last_updated":"2026-08-05T13:11:42Z","snapshot_observed_at":"2026-08-07T11:37:05.501493Z","submitted_at":"2026-07-10T08:51:14Z","title":"Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T04:42:35.589143Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2607.09207"},"observation_digest":"sha256:650b5cafe98fc1e2441de125bf5da6b9a70ab146b5c53d4fa45cb78074044573","observation_id":"4f69aa17-7c57-4d73-a9b0-1eade8a3b828","resolution":{"observed_at":"2026-07-13T04:42:35.589143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-01T06:48:17.223313Z","title":"arXiv preprint arXiv:2506.06122 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-07T09:56:42.250730Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.223313Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:55f47434af3922dd4f51a18ac603fb4be0049389d7f64bd3c5cb67480d69eb88","observation_id":"8dcd30dd-5f01-4957-979c-a3a7d152910c","resolution":{"observed_at":"2026-08-01T06:48:17.223313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-30T14:24:27.787441Z","title":"Reinforcement learning op- timization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23740","last_updated":"2026-07-26T16:25:45Z","snapshot_observed_at":"2026-08-05T16:02:02.141880Z","submitted_at":"2026-07-26T16:25:45Z","title":"Zing: Social Mind for LLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-30T14:24:27.787441Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2607.23740"},"observation_digest":"sha256:8c5e9ae40935f51c3ccb8a618a699fd124557ed92be708c871ed8230864773e5","observation_id":"a0af7cf3-3f4c-4b46-97c8-74e1d9486267","resolution":{"observed_at":"2026-07-30T14:24:27.787441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06122/citation-record","integrity":"/paper/2506.06122/integrity","json":"/paper/2506.06122/citation-record.json","paper":"/paper/2506.06122"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.442224Z","title":"https://openai.com/index/introducing-o3-and-o4-mini/, 2024","venue":null,"work_id":"5d242811-f6da-4529-ae9f-d26c97927709","year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.804104Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:81b457c5df06f582e7d494c102bf06d9fd400e6eb7830edf638228e460047322","observation_id":"ab363d8d-7b2f-4975-9a8b-c0d38603374e","resolution":{"observed_at":"2026-08-07T06:02:34.446681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.424451Z","title":"URL https://huggingface.co/datasets/Maxwell-Jia/AIME_2024","venue":null,"work_id":"1d9876dd-07c8-4cb6-9617-83167db5d3e3","year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.811590Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:39afe843a9cb28184439d125545ebccfcc8edb4db5e068401d9cebffafa53646","observation_id":"512580ab-0b0b-49a5-af3b-2db8b3a8261e","resolution":{"observed_at":"2026-08-07T06:02:34.429316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.410054Z","title":"https://qwenlm.github.io/blog/qwq-32b/, 2025","venue":null,"work_id":"9e8de081-507e-4e32-b880-e3083eaecf73","year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.815959Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:4d1e3cb407c997fa363321e09db33e1f8806c25b6b94c974fdbd35be916679c0","observation_id":"1096a416-8100-4e99-963a-1e24ec5b7fe3","resolution":{"observed_at":"2026-08-07T06:02:34.414382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.395942Z","title":"LMRL gym: Benchmarks for multi-turn reinforcement learning with language models, 2025","venue":null,"work_id":"36f981fc-77d7-4be7-92f7-c523d6b45cff","year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.820035Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:0011d46f77bd9a0cd22620f8f5452a2e1b7e50f54e5b20d31baf9f495d2aa95d","observation_id":"63217e89-5d4d-4da0-80ae-13cef1e56627","resolution":{"observed_at":"2026-08-07T06:02:34.400303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:32.824360Z","title":"Nemotron-crossthink: Scaling self-learning beyond math reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.824360Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:7c97ba5350a59b8ead3dcab6d21756624ed3d30af57c649bc452ff8ca24cb284","observation_id":"eb9c277d-b119-4769-8a15-803007d4add3","resolution":{"observed_at":"2026-08-07T06:02:32.824360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04257","last_updated":"2019-02-12T06:45:21Z","snapshot_observed_at":"2026-07-06T07:32:32.559105Z","submitted_at":"2019-02-12T06:45:21Z","title":"Deep Reinforcement Learning from Policy-Dependent Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04257","snapshot_observed_at":"2026-08-07T06:02:32.828557Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.828557Z"},"links":{"cited_paper":"/paper/1902.04257","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:b86472c2c8b8c0864a557cbe02d6e6f3a91ef176a55537fcf8930584e233f11c","observation_id":"3c4200e3-014b-46c1-bade-93478d5c1400","resolution":{"observed_at":"2026-08-07T06:02:32.828557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T06:02:32.834001Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.834001Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:f6760b4f607f0950c7a6def6bfe9f6d2cad3d60bbe123f45076d4909701262ab","observation_id":"2b5dd761-4421-4663-b2f4-bef60f31666f","resolution":{"observed_at":"2026-08-07T06:02:32.834001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:32.838170Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.838170Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:8ff8b38af4fb7bbdd72458ffced8b6ff2ad19b75b3028c45bfb54cd82e4691a2","observation_id":"cca0b717-263d-43b3-a1a4-5fc609de5d36","resolution":{"observed_at":"2026-08-07T06:02:32.838170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-04T13:01:58.606241Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-07T06:02:32.842355Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.842355Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:9b9d3484ecaec0c356b33a12e3a1e8d7a7a81c4165febf9c5fa70f98a8d6274f","observation_id":"f0035524-e9bd-45e4-8d53-2f1331ef07ed","resolution":{"observed_at":"2026-08-07T06:02:32.842355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T06:02:32.846754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.846754Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:031d8abd2cb5d545c70cae00f3f1ed520279f02bf3d5fe58b58dc539703aa877","observation_id":"793eeeff-3b8a-4ae4-83cb-b2c1da129e97","resolution":{"observed_at":"2026-08-07T06:02:32.846754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23074","last_updated":"2024-11-05T13:26:07Z","snapshot_observed_at":"2026-08-04T20:53:44.316168Z","submitted_at":"2024-10-30T14:46:43Z","title":"Multi-Programming Language Sandbox for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23074","snapshot_observed_at":"2026-08-07T06:02:32.853271Z","title":"Multi-programming language sandbox for llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.853271Z"},"links":{"cited_paper":"/paper/2410.23074","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:c8a1288c81469357ef7573876f1fd9a8a47cffa58261bf2d127f4987c9ed401a","observation_id":"9ff9f6ff-9cde-4b24-8e38-d7d5895e15dd","resolution":{"observed_at":"2026-08-07T06:02:32.853271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-07T06:02:32.857820Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.857820Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:2218fbe04dd5aeb2eec115ba23f222fc4eb77a9f638175c9fc2ea580a7b818d6","observation_id":"96b3d1f0-3812-48c6-a12e-2b744886c69f","resolution":{"observed_at":"2026-08-07T06:02:32.857820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24000","last_updated":"2025-03-31T12:23:31Z","snapshot_observed_at":"2026-07-06T21:01:22.941880Z","submitted_at":"2025-03-31T12:23:31Z","title":"Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24000","snapshot_observed_at":"2026-08-07T06:02:32.862408Z","title":"Rethinking key-value cache compression techniques for large language model serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.862408Z"},"links":{"cited_paper":"/paper/2503.24000","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:d53f7b3738e34642817562d0454678e73a44e324736133a4f56de81182690569","observation_id":"f2d3095f-0f99-4008-ad1c-ad9dbd9f0756","resolution":{"observed_at":"2026-08-07T06:02:32.862408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.371568Z","title":"NeMo: a toolkit for Conversational AI and Large Language Models , 2025","venue":null,"work_id":"c24bcbeb-b199-4c8c-b03a-e68aff129f0e","year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.867118Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:d8bea7c9d6905888527574ad194fbb0603a22018e3a40aed3427b3dbf683addf","observation_id":"28b6c286-7e98-473b-8f10-a6e470496c92","resolution":{"observed_at":"2026-08-07T06:02:34.376089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-07T06:02:32.870873Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.870873Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:459d7e5c446a585051e6308a8233c82c60226faaeb81a747e53e1d064b676f0e","observation_id":"d3e8f4f8-3665-4816-a5f4-b793aeb2c65c","resolution":{"observed_at":"2026-08-07T06:02:32.870873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-05T09:48:25.127042Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T06:02:32.875169Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.875169Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:b7cac937120b7bbc60e766c7974b83c3af9b651962a2c4ad0953647e28453334","observation_id":"683195ac-343c-4526-8a60-3fb774b83e18","resolution":{"observed_at":"2026-08-07T06:02:32.875169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T06:02:32.879473Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.879473Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:91d61782721562638681fb1fc4c529e38ae20c50064f65f3d210dd9d88873df8","observation_id":"be8d13dc-eb44-4a95-90e6-5cf38a3a11eb","resolution":{"observed_at":"2026-08-07T06:02:32.879473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:32.884352Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.884352Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:4ea6c481eea09c04a63ed09f6ab9b4bcc90f23cf79d46f4f584c9b767631978f","observation_id":"8651b302-d6ce-4d89-bb60-861847e44f6a","resolution":{"observed_at":"2026-08-07T06:02:32.884352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v24i1.7690","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.150870Z","title":"Reinforcement Learning Via Practice and Critique Advice","venue":null,"work_id":"cbbc7794-7179-495a-a823-62183c09f1b8","year":2010},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.889336Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:a58cb305a8990b56f5e61bc2b4de440ba9a5993eec33a58b696521db101f1391","observation_id":"056139c0-5239-4443-b06f-420c0720588a","resolution":{"observed_at":"2026-08-07T06:02:33.155236Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.347160Z","title":"Bradley Knox","venue":null,"work_id":"ca656f3d-e05d-4eaf-8b68-37c239a40c11","year":2012},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.893785Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:771f9ac827c778565571273d4e365900c1b59db08145e7926dcd7d405d035d91","observation_id":"b5f7a72e-29d9-4520-8d3e-4bb2cf6255b0","resolution":{"observed_at":"2026-08-07T06:02:34.351460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7735.15977","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.688787Z","title":"Bradley Knox and Peter Stone","venue":null,"work_id":"63b42b81-ea56-479f-8418-64429e9929bd","year":2009},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.898885Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:15638c517d8e12480ac7b2ad1b05565ae5af5b92a95dece6c761d4f51a593f5a","observation_id":"90fb3b8c-b6d4-4915-930c-4261edaf2eb8","resolution":{"observed_at":"2026-08-07T06:02:33.696419Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:32.904314Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.904314Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:c761e184f2b0363b56860ae4f335882a89be549432512685f114f70c76cd4a0f","observation_id":"ad75e3a8-6c0b-4028-a972-b3872e325934","resolution":{"observed_at":"2026-08-07T06:02:32.904314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T06:02:32.908648Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.908648Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:a99343b3ef746daaa165e282e320f42bb12ea8c2543001bb6e8c330e04857096","observation_id":"615c330c-4bd4-4a25-b56c-5d755219493d","resolution":{"observed_at":"2026-08-07T06:02:32.908648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.319682Z","title":"\\ PUZZLE \\ : Efficiently aligning large language models through \\ Light-Weight \\ context switch","venue":null,"work_id":"b05cf3f9-88be-4423-a1a0-9afd7c533696","year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.913814Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:2b0cf79389c300a3f8422e189e7dbf49c393963d79020f19e2527c38e2749ecc","observation_id":"8f00ffe9-e3b6-4ce6-a072-b46b04f10ab9","resolution":{"observed_at":"2026-08-07T06:02:34.324242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03294","last_updated":"2024-03-31T21:11:08Z","snapshot_observed_at":"2026-08-07T06:18:54.374420Z","submitted_at":"2023-10-05T03:47:57Z","title":"DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03294","snapshot_observed_at":"2026-08-07T06:02:32.918029Z","title":"Distflashattn: Distributed memory-efficient attention for long-context llms training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.918029Z"},"links":{"cited_paper":"/paper/2310.03294","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:c0461a29ac3ca356cac87796c98b7d41408b95a36aada4aa2338cf3fe8c14c70","observation_id":"a51ce3ff-543c-4194-beae-29d86be9df15","resolution":{"observed_at":"2026-08-07T06:02:32.918029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-07-06T11:13:16.760403Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T06:02:32.922834Z","title":"Sequence parallelism: Making 4d parallelism possible","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.922834Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:f2b76edf28f019175d9c36408f58ac23d1898bc951cc34906100d7e7246d9230","observation_id":"4397b7e9-5a51-4462-97ae-4f0f935b4ab0","resolution":{"observed_at":"2026-08-07T06:02:32.922834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.305963Z","title":"2 D - DPO : Scaling direct preference optimization with 2-dimensional supervision","venue":null,"work_id":"07ae26c8-8a9f-47c9-aa7e-1434fbb7385c","year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.927878Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:a84ccf42e141a31aa4a7c1ffb76930bbfc15f2980fc1037aebbc9565d3debb90","observation_id":"a44c0d5f-64d6-4a0a-9fc7-8da28e0b317c","resolution":{"observed_at":"2026-08-07T06:02:34.310187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.292176Z","title":"MMI ference: Accelerating pre-filling for long-context vlms via modality-aware permutation sparse attention","venue":null,"work_id":"f142295e-a057-4c61-82fc-3cda4aba85c4","year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.932348Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:cc296cf0fe213db5b9f49d3a8b19efb7bf5f41eab8618d654a816dbc24b55563","observation_id":"406a2f89-b656-4de2-99cb-2610d173383f","resolution":{"observed_at":"2026-08-07T06:02:34.296688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.277048Z","title":"Remax: A simple, effective, and efficient method for aligning large language models","venue":null,"work_id":"473c1609-9717-439f-b9f0-34c3169fe70c","year":2023},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.936775Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:47fb54dd4935896e98829bd176f4109cdf4cecd33b5ede180541e265f64c595e","observation_id":"e7b4d3f4-ebb4-4e22-9f10-77a51fd73506","resolution":{"observed_at":"2026-08-07T06:02:34.282458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.262545Z","title":"Agentbench: Evaluating LLM s as agents","venue":null,"work_id":"8492dcce-2784-4ff8-be08-5a4c30756198","year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.940884Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:b24adaa1989f3163853733d931344a29d93416d814ac0a561b6b88ece90070e3","observation_id":"a09bc472-20b0-4139-99ed-bb10412582e2","resolution":{"observed_at":"2026-08-07T06:02:34.266836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T06:02:32.945286Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.945286Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:163950ee1f8dbea45c403efd539c1c3eafcafd74c310ce71ed6b255404541853","observation_id":"64a4cfb5-9d1c-418b-beef-f05dc3f30fd8","resolution":{"observed_at":"2026-08-07T06:02:32.945286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.248362Z","title":"Giving advice about preferred actions to reinforcement learners via knowledge-based kernel regression","venue":null,"work_id":"ad8ca7e5-6c8e-41bd-a7bb-e73a15129a0e","year":2005},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.949346Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:51be8e59813189fbbc5bd87012e0b1c95e7e159663aab6ff5b1cd6e83795b136","observation_id":"5806a8e1-d95b-4688-b1ac-4adc6101a954","resolution":{"observed_at":"2026-08-07T06:02:34.253154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14088","last_updated":"2025-04-24T13:24:42Z","snapshot_observed_at":"2026-07-06T18:34:07.264237Z","submitted_at":"2024-06-20T08:04:07Z","title":"ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14088","snapshot_observed_at":"2026-08-07T06:02:32.953420Z","title":"Realhf: Optimized rlhf training for large language models through parameter reallocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.953420Z"},"links":{"cited_paper":"/paper/2406.14088","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:2bf7b909a93f795c50437ced06e245cb72d16656f8a446ea0662b7765d090479","observation_id":"fda7b7fa-5ba2-4757-93b0-eeb1cbb426da","resolution":{"observed_at":"2026-08-07T06:02:32.953420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.231319Z","title":"Deepspeed autotuning","venue":null,"work_id":"0d0a64ab-e691-4f63-b534-d04aa6303dd0","year":2021},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.959359Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:066fc83466c95d466243ca868d3ecd167c6c78fa5edbf14bf061378d1d4db716","observation_id":"defc11c7-f3aa-457b-90db-c9975613fc73","resolution":{"observed_at":"2026-08-07T06:02:34.236231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.216486Z","title":"Jordan, and Ion Stoica","venue":null,"work_id":"fa66b272-37e0-424c-b13d-613241804856","year":2018},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.965937Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:448660f90e53d039b547f5645b2f77df25bcca26650d8e2816a421dba2361c3f","observation_id":"123395c2-3d21-432f-9930-228d98f2d3da","resolution":{"observed_at":"2026-08-07T06:02:34.220809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.186117Z","title":"Codeforces Dataset , 2025","venue":null,"work_id":"190bce5c-f39f-487e-93fc-e7eb08fb38c5","year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.970461Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:c78da765519c991766fd8f125a0ce156f151c3f326a26670dc7957626ca26270","observation_id":"3a5065d3-99e7-4fd3-891e-2949c7603e78","resolution":{"observed_at":"2026-08-07T06:02:34.206003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:32.975022Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.975022Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:1424f542065edbf2de969ac280d1912f757ffebc7e78f9b3b5e60b844b02e52c","observation_id":"a1697028-1a66-4132-9bb1-b72fb554c0e7","resolution":{"observed_at":"2026-08-07T06:02:32.975022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21139","last_updated":"2025-06-06T07:53:20Z","snapshot_observed_at":"2026-07-06T20:14:49.976782Z","submitted_at":"2024-12-30T18:15:39Z","title":"Training Software Engineering Agents and Verifiers with SWE-Gym","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21139","snapshot_observed_at":"2026-08-07T06:02:32.979143Z","title":"Training software engineering agents and verifiers with swe-gym, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.979143Z"},"links":{"cited_paper":"/paper/2412.21139","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:6885c7d9ffab0828d7518a1db7730b7206c0f4ebec5b5f6103596d1a1133a2a1","observation_id":"27d00742-6fb2-48e7-9c2b-b7117f3999f9","resolution":{"observed_at":"2026-08-07T06:02:32.979143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T06:02:32.983611Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.983611Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:974ae10e4f97a83a87e84774168ca20ed782f6db21de4ce9470f2a22130269a4","observation_id":"633b5127-42d9-4779-a1e5-7cdf14c0ff53","resolution":{"observed_at":"2026-08-07T06:02:32.983611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:32.987821Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.987821Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:58770237db100bae37d6ae3bf8213d952481db53437996313a4358c203c26a7f","observation_id":"d18e43d9-aaca-4ef0-bb16-eeeeb14d299a","resolution":{"observed_at":"2026-08-07T06:02:32.987821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.128034Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":"cbe111cb-e129-4a44-a8c4-263b9d0b63c8","year":2022},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.992239Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:5b28d7291230a8fb6d34efc7b1204a752f4194888cba03443620190342295979","observation_id":"46f32bd2-0b30-4ab9-a40c-980c200795e6","resolution":{"observed_at":"2026-08-07T06:02:34.140846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.098684Z","title":"\\ Zero-offload \\ : Democratizing \\ billion-scale \\ model training","venue":null,"work_id":"4b8052c7-cea4-4d70-aaf3-ea1d04f5704b","year":2021},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.997027Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:b331051f206ff0e886be33cb5ccba882faaf620ba7d63b235e0dada8dc020783","observation_id":"927c602d-c083-4269-ab55-c88aa426d8c0","resolution":{"observed_at":"2026-08-07T06:02:34.107266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T06:02:33.001110Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.001110Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:b71416a7613cb8a7887ce24e657b23d798436e64fc4408a0874278c0167ae8b8","observation_id":"c66bf214-1d17-4cad-882e-9f3369c3361c","resolution":{"observed_at":"2026-08-07T06:02:33.001110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T06:02:33.005872Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.005872Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:3a9f07d222849dd21b70d906092bff568d46a621c13f18900a37334846a2dc7d","observation_id":"da40d64a-8569-4411-9254-4304e9b63ba6","resolution":{"observed_at":"2026-08-07T06:02:33.005872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.010006Z","title":"Seed-thinking-v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.010006Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:c2eafae467a8b25313aca3c3b434eacb09daa4978ba5ce7a71475798f5deb4e1","observation_id":"b291a80f-b68d-48ab-a4db-a12b72032a51","resolution":{"observed_at":"2026-08-07T06:02:33.010006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:34.048497Z","title":"Sglang: Fast serving framework for large language models","venue":null,"work_id":"2d41f33b-f70e-4d31-bdd4-386c996e00f7","year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.014019Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:9ba8cb3957ae86f7a876feec4aee7ee16da64f65b68f8be1a973caaac90af356","observation_id":"3e957aad-b38a-4f15-8153-d1dce9d3d95e","resolution":{"observed_at":"2026-08-07T06:02:34.081743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T06:02:33.017868Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.017868Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:1d431b4993d97f0381a5a747cb82207881e8bc46a470957afb96b382bb7cb079","observation_id":"370f16b0-649d-43df-b2dd-35ec2da6d49e","resolution":{"observed_at":"2026-08-07T06:02:33.017868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T06:02:33.021832Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.021832Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:ca972a711d6ae0da69374c8bd72effd65a7387c974035d3aae0bac4e13c3aaec","observation_id":"b23fa2d8-71d9-4169-8408-6b79ee715869","resolution":{"observed_at":"2026-08-07T06:02:33.021832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T06:02:33.026092Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.026092Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:e2d2bd9872704d66665f32ef9161bb99632e4448c60ae7181bdeb1369c56fb31","observation_id":"a8bcd306-525c-4606-b0d6-0eb8a9030166","resolution":{"observed_at":"2026-08-07T06:02:33.026092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11239","last_updated":"2024-10-02T11:07:14Z","snapshot_observed_at":"2026-08-03T08:44:22.056144Z","submitted_at":"2024-09-17T14:40:02Z","title":"LLM-as-a-Judge & Reward Model: What They Can and Cannot Do","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11239","snapshot_observed_at":"2026-08-07T06:02:33.030635Z","title":"Llm-as-a-judge and reward model: What they can and cannot do, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.030635Z"},"links":{"cited_paper":"/paper/2409.11239","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:9a081eb3425fe9e6a8aeddabf2c3a1f44c5724b1b8803f5b1d8a35808fa04ddf","observation_id":"735ce3c0-d2bb-4b5f-be3c-410c65cf066e","resolution":{"observed_at":"2026-08-07T06:02:33.030635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-07-06T21:01:17.931818Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T06:02:33.035346Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.035346Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:1101a62958bc06283a59b4b7fa47f72daba2bf4c04f53f9d228f19b4604a322f","observation_id":"4f20c883-72af-4be5-b670-ffd717f77947","resolution":{"observed_at":"2026-08-07T06:02:33.035346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-07T06:02:33.039639Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.039639Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:cfa39866fdce4c694d7efa586cd0667e005bc96fc82928ab20fad38e5a995728","observation_id":"ccacab87-c5a4-4bef-b8c4-7defe3dc7e0e","resolution":{"observed_at":"2026-08-07T06:02:33.039639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.11485","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.134062Z","title":"Deep TAMER : Interactive Agent Shaping in High-Dimensional State Spaces","venue":null,"work_id":"d25cc9b5-c5ed-41e5-bbb9-1a5cb64aa5a6","year":2018},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.043759Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:523f285253583bb279518917195cf169d0d33bf0fbf446d9eab5d0c044c99f24","observation_id":"de5044b5-9486-4bb7-84fc-3278acc94c7d","resolution":{"observed_at":"2026-08-07T06:02:33.140311Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-07-06T20:46:46.095651Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-07T06:02:33.047913Z","title":"Kodcode: A diverse, challenging, and verifiable synthetic dataset for coding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.047913Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:1104e3db8962a798e3cfb45bbba7e56c3f10cd03dff261b57adedc568319c96b","observation_id":"93fe47af-8199-4c12-9e38-51a65f955481","resolution":{"observed_at":"2026-08-07T06:02:33.047913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T06:02:33.052451Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.052451Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:ac27d36d3d51f2d96b48ba950e7845148839522c478c94cb86b2a4ce48935b76","observation_id":"2aa1046d-820a-47b7-93e7-aa2b8b71956e","resolution":{"observed_at":"2026-08-07T06:02:33.052451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.056426Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.056426Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:e9de822d1bd547c506637acc9857fc4e560b3f19c981db258214e0290a64abca","observation_id":"2efadbfd-edfb-4181-b9f7-132155bc0036","resolution":{"observed_at":"2026-08-07T06:02:33.056426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16849","last_updated":"2024-12-22T04:21:30Z","snapshot_observed_at":"2026-08-03T21:50:10.739589Z","submitted_at":"2024-12-22T04:21:30Z","title":"OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16849","snapshot_observed_at":"2026-08-07T06:02:33.060236Z","title":"Openrft: Adapting reasoning foundation model for domain-specific tasks with reinforcement fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.060236Z"},"links":{"cited_paper":"/paper/2412.16849","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:6fb851f753d5dec8da354862884e8e44e040d8b26aba07b16e700ef1d6056349","observation_id":"68bec4cf-22ee-441b-8a54-330e0d72bbc7","resolution":{"observed_at":"2026-08-07T06:02:33.060236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T06:02:33.064390Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.064390Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:54fd142e9b6e4b779b80f4d3a41ae30171acba90eadfd4514573df1997e3e72d","observation_id":"6dc93f18-6194-4cba-bd60-729ece3974ec","resolution":{"observed_at":"2026-08-07T06:02:33.064390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13221","last_updated":"2025-04-22T14:32:59Z","snapshot_observed_at":"2026-08-05T20:20:37.353719Z","submitted_at":"2024-09-20T05:15:38Z","title":"Optimizing RLHF Training for Large Language Models with Stage Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13221","snapshot_observed_at":"2026-08-07T06:02:33.069126Z","title":"Rlhfuse: Efficient rlhf training for large language models with inter- and intra-stage fusion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.069126Z"},"links":{"cited_paper":"/paper/2409.13221","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:1049fef4a1fe92021026cfadbca7f3ed64e31f4f1cd571d54b56089e62e3b0f1","observation_id":"cdaff5c4-cb20-4e3e-bf71-6da010ba40a2","resolution":{"observed_at":"2026-08-07T06:02:33.069126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-07-06T21:13:04.549829Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-07T06:02:33.073265Z","title":"Streamrl: Scalable, heterogeneous, and elastic rl for llms with disaggregated stream generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.073265Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:19a021c631f83b7c6c98a43c3835c9a1cc227fbe9a3527f69ab3612688d8c9b3","observation_id":"4f11a428-3c5d-49a9-bcf4-d8d0d4410b22","resolution":{"observed_at":"2026-08-07T06:02:33.073265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.077517Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.077517Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:146f8d3064399dde60af9493d53c2a90dc1553d73527b997b1297973c5af4fbd","observation_id":"9ac5e8ab-15e7-49d2-96fe-10d5b3a07f41","resolution":{"observed_at":"2026-08-07T06:02:33.077517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.959751Z","title":"Ar CH er: Training language model agents via hierarchical multi-turn RL","venue":null,"work_id":"d216fed4-73f4-44d3-8296-ff3347c38c85","year":2024},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.081676Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:7894b813affcd45858d2188bd193eb0274ab073a59816ca6a561b144632967cf","observation_id":"c54788d8-f16d-4631-8d1d-3d7393188dbe","resolution":{"observed_at":"2026-08-07T06:02:33.985545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.085783Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.085783Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:3a1dd17e6b5f36ecb40ed7f637f62a7ae9fe3e88cc337d4d0e8cf195d346acf2","observation_id":"feaa7981-0591-492c-af26-a8a78b1dd2c2","resolution":{"observed_at":"2026-08-07T06:02:33.085783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.090557Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.090557Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:822ccbada619e749625ac8bfc7be96b4ce8a604ee37e9b83d14315637072d52f","observation_id":"a5292bed-1d2d-4471-b832-a9d43a5904c0","resolution":{"observed_at":"2026-08-07T06:02:33.090557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.094738Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.094738Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:7932bf922eb40d29a2db78bec6566085e858bb57f2089ae26295d58b30f14065","observation_id":"78be3607-5a0c-4183-975a-66aa7cb91b35","resolution":{"observed_at":"2026-08-07T06:02:33.094738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:33.099054Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.099054Z"},"links":{"citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:55ed646f40ba7f2f5aa1eebea20c007b23ffaa7d43d600ea85592ebb6122eded","observation_id":"0892558c-3855-4e65-96a6-48ba4c59a46c","resolution":{"observed_at":"2026-08-07T06:02:33.099054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:57:51.651716Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 36 inbound Pith citation observations for arXiv:2506.06122."}