{"as_of":"2026-08-18T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:969e8a370b44b7524d408ffcfc73e3d5d76d844336974a00cf093d3b29c508b2","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T09:49:31.823521Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21653/citation-record","integrity":"/paper/2607.21653/integrity","json":"/paper/2607.21653/citation-record.json","paper":"/paper/2607.21653"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:24.955761Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:24.955761Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:93168e298579a259055c112919e4a90e484eb1fc85a86a2a89dc4af00cc21bad","observation_id":"169d5e94-0897-4aaf-ab07-4d181591a69e","resolution":{"observed_at":"2026-08-01T09:49:24.955761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:25.105821Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:25.105821Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:4b9fd9930039146142fd7aaa947ee5b7bea1ba7c76e52ff721773e621844c52b","observation_id":"57e14c27-f090-49f1-956c-2c70226cee1b","resolution":{"observed_at":"2026-08-01T09:49:25.105821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:25.301575Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:25.301575Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:e625127cb77d5b27469ae07b440e4a9c0d969bcf29adbed2ed67baa9d0b0a086","observation_id":"2733aa50-7cd1-4214-9f4c-d5e308c9d401","resolution":{"observed_at":"2026-08-01T09:49:25.301575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:25.446644Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:25.446644Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:a36d3dcebb6b5f2e1fae6cd76762fb3d723589846c778cc3442d9b2302c1eb09","observation_id":"524d3b2b-94cd-4465-b5ae-79b1b6ccea87","resolution":{"observed_at":"2026-08-01T09:49:25.446644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:25.584160Z","title":"Laminar: A Scalable Asynchronous","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:25.584160Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:f14a6d18c03a485d187e8480f1c5adc11b6edf555fb78c36b05242b3bf17ac2d","observation_id":"43cc60cc-2c5e-4c77-b040-5df844775a04","resolution":{"observed_at":"2026-08-01T09:49:25.584160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:25.735099Z","title":"Stabilizing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:25.735099Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:f1db87a7e811e76953bab264a13387cc47651419b03978ba2d10e8fc387cc44b","observation_id":"0ee07cb2-abc2-4351-83b6-0b530f24a4d7","resolution":{"observed_at":"2026-08-01T09:49:25.735099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:25.921083Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:25.921083Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:3faeac77e8ba3fb73f1cc1d914a4bfaaa0ad369b0bf237304f9c43573d57896a","observation_id":"1f495a41-c1d5-4289-8078-4685b1cbb706","resolution":{"observed_at":"2026-08-01T09:49:25.921083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:26.109608Z","title":"Polar: Agentic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:26.109608Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:63198fb7f1d63ac6570613fc38efa5c6d3c8eddef1266bcb8c4fbab41cad4efa","observation_id":"4e0e083e-fdb5-4295-b431-8844095c498a","resolution":{"observed_at":"2026-08-01T09:49:26.109608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:26.337132Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:26.337132Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:2eed1c7a681c45bb1c8a860f336905e29492b70fa7f94abeffbcdb3a157a5c0b","observation_id":"f8f51995-d4e6-40da-b849-dd27d25edb63","resolution":{"observed_at":"2026-08-01T09:49:26.337132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:26.481742Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:26.481742Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:283e42d8be410d7216edb59cd493eba2416561f54fad824b44d3c568cb1a358e","observation_id":"39b9d0b4-3124-48dd-ac64-8e3fbf0632ce","resolution":{"observed_at":"2026-08-01T09:49:26.481742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:26.635910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:26.635910Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:14664e50c3561f75c632f9cbc131732a8fb8b9a4fe7679327441555abf348be4","observation_id":"3a614a4e-908e-4769-a152-dc7129e941e9","resolution":{"observed_at":"2026-08-01T09:49:26.635910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:26.802812Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:26.802812Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:76610e2f56ca4e6a0fd573d2b43d20d633ca8bfb265d77adeab7cc6e813aae63","observation_id":"8bf6ffa0-fc0e-4a64-97ac-2ced3c95de80","resolution":{"observed_at":"2026-08-01T09:49:26.802812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:26.983344Z","title":"and Barrett, Clark and Sheng, Ying , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:26.983344Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:b3e24fc905d7541f177c687b7709c68c4c84223a07063209594d93d5f032521a","observation_id":"dd0b2436-ff5a-42a4-8c99-a25afa36678e","resolution":{"observed_at":"2026-08-01T09:49:26.983344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.162372Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.162372Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:6a90905eff2449a45f5c50db41515bf05cc4d0d2a0c2731b41b7d49603c1e49b","observation_id":"85bd74cd-14a9-44a5-9adf-f519f40301d5","resolution":{"observed_at":"2026-08-01T09:49:27.162372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.311015Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.311015Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:148efe0581741960dfe5e9699150e6fd8e11e8195919630ce25fe7907b01658b","observation_id":"f7dae37a-047d-41f5-a905-123bdaa42063","resolution":{"observed_at":"2026-08-01T09:49:27.311015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.367566Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.367566Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:44a0e386dba3ed398e7465afc6df2b08b12fef16519c9806bc887872d4e2851c","observation_id":"909a516f-9848-4f18-83a7-0b6d55bde502","resolution":{"observed_at":"2026-08-01T09:49:27.367566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.517223Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.517223Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:dafc78786ddf0914e3650ea529a521a48b27b80342b8a2ddfe848e69ec7a72f0","observation_id":"20da812d-47eb-4afc-8971-3c887eefa3fc","resolution":{"observed_at":"2026-08-01T09:49:27.517223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.648442Z","title":"and Zhang, Hao and Stoica, Ion , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.648442Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:46fcdd40563bba9324edd931c5fb6591272b200fb3bcc51ea866a145a02e64f9","observation_id":"1465e5b7-aa28-4ebe-b50e-424149d8b2e2","resolution":{"observed_at":"2026-08-01T09:49:27.648442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.728162Z","title":"and Stoica, Ion , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.728162Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:ea3f734ab722c981d746102d1628a9e88b0611bf43a5527b053013ecc3a9fdea","observation_id":"ff47368a-5bc5-4128-8c07-6cc64261bfae","resolution":{"observed_at":"2026-08-01T09:49:27.728162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.796451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.796451Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:ecc543abe7af75981781ede25b1b64f963e12af9e33272beb90fa011e15ef4b1","observation_id":"bd3548b2-1621-412c-8605-c5f3e1d8a8fe","resolution":{"observed_at":"2026-08-01T09:49:27.796451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.862469Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.862469Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:9b908fa317ca0110f1f2479c0b5f10b2878e7c1f5f87feff6ed627c5e1ab8563","observation_id":"7058c24d-2e1a-4947-aa6d-f1628b4c1888","resolution":{"observed_at":"2026-08-01T09:49:27.862469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:27.943534Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:27.943534Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:d7df1ccebc7ec47eb71d045b4504404dfb7c490955d14dac63ac7a30b5c7122f","observation_id":"3818632c-8277-4616-88f2-2f5aba1d0357","resolution":{"observed_at":"2026-08-01T09:49:27.943534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:28.044364Z","title":"and Yang, Yuqing , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.044364Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:dc6f49312444d79c1d31e41e1dbf37f525fcfd4abbf15b9abcf1a8f83a4c4270","observation_id":"95a1e4b1-914b-450a-a949-ef468cdb288e","resolution":{"observed_at":"2026-08-01T09:49:28.044364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:28.128160Z","title":"When Speed Kills Stability: Demystifying","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.128160Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:9f4270131fc8f0d23839286284c58bf1b5d24c105fb17b27d43f50baf2a0955b","observation_id":"c3f02915-804a-4d72-99fa-761805eefe7b","resolution":{"observed_at":"2026-08-01T09:49:28.128160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:28.288163Z","title":"Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.288163Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:a706ca9f29ab8a53b43dc6bf002a791824d097ec8c7a3406ca37e7e523eee72e","observation_id":"2694c4b7-3202-4cc7-b893-f0fd11245bc9","resolution":{"observed_at":"2026-08-01T09:49:28.288163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:28.368498Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.368498Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:343d7cfcaa21ee63348c0ada818b7190886216b73605627db846307a2a717823","observation_id":"ce0c8919-f800-4303-aa4a-0813e4f916a9","resolution":{"observed_at":"2026-08-01T09:49:28.368498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-01T09:49:28.534055Z","title":"Back to basics: Revisiting REINFORCE -style optimization for learning from human feedback in LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.534055Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:3a809ed12e5de50420886b51959c2cddef47ca6e6c7a79a7d41c94216877fdc7","observation_id":"4f74df15-cba2-4cb2-a4c1-20b56a18c131","resolution":{"observed_at":"2026-08-01T09:49:28.534055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-01T09:49:28.640558Z","title":"OpenAI Gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.640558Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:e2dd0592e8995029af5476d0f5bacd03795be08a2ac30c3d931ace5c9e1e8707","observation_id":"8ac76f72-7b09-4b87-ad9b-7fab3beeab8e","resolution":{"observed_at":"2026-08-01T09:49:28.640558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26997","last_updated":"2026-07-05T07:05:22Z","snapshot_observed_at":"2026-08-13T05:19:40.001059Z","submitted_at":"2026-06-25T13:14:14Z","title":"RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26997","snapshot_observed_at":"2026-08-01T09:49:28.700382Z","title":"RolloutPipe : Overlapping pipelined rollout and training in disaggregated on-policy LLM reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.700382Z"},"links":{"cited_paper":"/paper/2606.26997","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:eac32403af26b28976e903ec80f27777c2da9f071e54f6df7e30272ea75403d4","observation_id":"7164737e-8b03-4d42-8053-986528121718","resolution":{"observed_at":"2026-08-01T09:49:28.700382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-01T09:49:28.768314Z","title":"DeepSeek-V3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.768314Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:86757a0c1f410955572818f5870351b5da91f56a9e1e97bdc1ba3c16b865d37a","observation_id":"aa3c69e7-334c-4751-850c-eb974ac2e515","resolution":{"observed_at":"2026-08-01T09:49:28.768314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-01T09:49:28.853734Z","title":"AReaL : A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.853734Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:9d6611a3170e23363521d110918b2f0f6e7e885714bd5f94a005bd6c9b2c3f5f","observation_id":"7f2db113-7f86-4a24-8845-7519a8acf1ce","resolution":{"observed_at":"2026-08-01T09:49:28.853734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:28.934558Z","title":"RollArt : Disaggregated multi-task agentic RL training at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.934558Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:a62da99c15a42bf80eba9b77a4803ab65af16af7ceb5de869f31ee86ea8dab9d","observation_id":"65851560-8aec-47ff-a848-82a693f9d033","resolution":{"observed_at":"2026-08-01T09:49:28.934558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T09:49:28.942046Z","title":"DeepSeek-R1 : Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.942046Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:b845121bc790c3dd3289c52f36f85c740c0193c143103732d3a014d46d29f6d9","observation_id":"4c8d6e8d-30b9-4e5e-916c-53c7ca0360fd","resolution":{"observed_at":"2026-08-01T09:49:28.942046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-18T04:26:49.778619Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-01T09:49:28.947139Z","title":"OpenRLHF : An easy-to-use, scalable and high-performance RLHF framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.947139Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:54964b4dae46d33cb3eaee3001be6f1c8f96909e98a20c4487e5c8eeaee85659","observation_id":"6f80a6e7-f801-412e-bda9-2a853337e2ba","resolution":{"observed_at":"2026-08-01T09:49:28.947139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-01T09:49:28.999598Z","title":"REINFORCE++ : Stabilizing critic-free policy optimization with global advantage normalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.999598Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:ee88dad3bad767c1c157bc84510d83496a323c86cea3c76446ce8c806dbbfb23","observation_id":"3a54e877-88d7-4288-a924-63f9b6dfc584","resolution":{"observed_at":"2026-08-01T09:49:28.999598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26256","last_updated":"2026-04-29T03:25:36Z","snapshot_observed_at":"2026-07-06T23:11:57.238808Z","submitted_at":"2026-04-29T03:25:36Z","title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26256","snapshot_observed_at":"2026-08-01T09:49:29.089164Z","title":"DORA : A scalable asynchronous reinforcement learning system for language model training","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:29.089164Z"},"links":{"cited_paper":"/paper/2604.26256","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:bb9ecb895507d3e7d64df9d01c2646ef12815f47efe36cf219be3fcacf7e9aff","observation_id":"032c9881-1857-46f3-b18f-ef9548bc4cce","resolution":{"observed_at":"2026-08-01T09:49:29.089164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:29.176487Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:29.176487Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:7a5a777ec663bcd7cd9b703167f7e92c1493b5c3bedfcb2a98bdcf728b15cbb9","observation_id":"1c2096ac-b5bd-4510-9b9f-88eeaf63604e","resolution":{"observed_at":"2026-08-01T09:49:29.176487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:29.306484Z","title":"When speed kills stability: Demystifying RL collapse from the training-inference mismatch","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:29.306484Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:cf195d881fe47bd07dec1c94c94e146b062eb9f52801347d2e30ba8a775d6b2c","observation_id":"f977c3a0-f5bf-425b-ba57-c2fcc1bcfd04","resolution":{"observed_at":"2026-08-01T09:49:29.306484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-01T09:49:29.455614Z","title":"Understanding R1-Zero -like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:29.455614Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:14077edecc47d54618b314a4dbf1aebfd867f8b87a565fcc1c050c9092fff8d2","observation_id":"32a94d8c-bfa4-461b-aca9-a886a35ff35b","resolution":{"observed_at":"2026-08-01T09:49:29.455614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-15T03:48:34.730767Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-01T09:49:29.589477Z","title":"Qiu, and Yuqing Yang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:29.589477Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:fe4aafa3ae1cca05b03303a512553e5984622b11dbe1ef74d5367eefd4da51c1","observation_id":"10f4918a-182a-47d9-bff4-716a6e3ab1ac","resolution":{"observed_at":"2026-08-01T09:49:29.589477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:29.743736Z","title":"Stabilizing MoE reinforcement learning by aligning training and inference routers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:29.743736Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:a0efab60312ec6441c105c6caa91c236e9bb01cd632fd0dd9aeb6aa77e7bec5b","observation_id":"3766b57f-6236-4697-82a1-7c89dd2c0d35","resolution":{"observed_at":"2026-08-01T09:49:29.743736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:29.883445Z","title":"Jordan, and Ion Stoica","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:29.883445Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:9c68e25bf76787e6e25303f95ac3a205f0d8379651bfa745c4b10157a504d6ff","observation_id":"1775cd88-1944-43b8-a6ea-9d0d19736d4c","resolution":{"observed_at":"2026-08-01T09:49:29.883445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:30.016758Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:30.016758Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:52e5d0e53d41aecd36dc24d3ec72350d3ae752af3f38ceb784c09a93a0077aeb","observation_id":"53ee4424-189e-4cf7-9f4c-3eb8fe59f823","resolution":{"observed_at":"2026-08-01T09:49:30.016758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T09:49:30.124552Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:30.124552Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:18feaac63e9971c5b8729c40d6f44df1cac151c961dd7ca76926201205f46271","observation_id":"2f052a68-1122-4f63-bf7c-c808b0a9f3dd","resolution":{"observed_at":"2026-08-01T09:49:30.124552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T09:49:30.274180Z","title":"DeepSeekMath : Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:30.274180Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:65301e5b2599b67bedcee5c646859ba4044052e0d936a47288ddf83e2203fee5","observation_id":"53615c33-5cd4-4638-b25f-e2d606bffee1","resolution":{"observed_at":"2026-08-01T09:49:30.274180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:30.428726Z","title":"Laminar: A scalable asynchronous RL post-training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:30.428726Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:7f9901fb34083a775d8e9507d1ce8422e4285ab9a9469eb3ca6116c1dbb9c660","observation_id":"a18c5adc-9c31-416c-bef8-523fd5b64570","resolution":{"observed_at":"2026-08-01T09:49:30.428726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:30.576484Z","title":"HybridFlow : A flexible and efficient RLHF framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:30.576484Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:e6c372a83860108b9823b3e0b134b6e393f3d8faafc69093e23605aaa956eee8","observation_id":"a85b83f0-2982-4164-8d08-03090b49d7d6","resolution":{"observed_at":"2026-08-01T09:49:30.576484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:30.729399Z","title":"OSWorld : Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:30.729399Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:896c6c0931e523c5043db593a1ea89ea108226273c728cff8b451c067ff9d622","observation_id":"67da6d4a-df23-49f6-a9a6-395678902471","resolution":{"observed_at":"2026-08-01T09:49:30.729399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24220","last_updated":"2026-05-22T21:06:12Z","snapshot_observed_at":"2026-07-06T23:34:18.555542Z","submitted_at":"2026-05-22T21:06:12Z","title":"Polar: Agentic RL on Any Harness at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.24220","snapshot_observed_at":"2026-08-01T09:49:30.880046Z","title":"Polar: Agentic RL on any harness at scale","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:30.880046Z"},"links":{"cited_paper":"/paper/2605.24220","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:7d219e585621623cfa26f194c35d87d54bade9900e72b117e8782c21b8e2bc5e","observation_id":"5b21a729-fd86-4cf5-b580-1adf8cc3ca45","resolution":{"observed_at":"2026-08-01T09:49:30.880046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.01120","last_updated":"2026-07-02T14:02:28Z","snapshot_observed_at":"2026-08-09T10:40:08.574574Z","submitted_at":"2026-07-01T16:08:02Z","title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.01120","snapshot_observed_at":"2026-08-01T09:49:31.023088Z","title":"Next-generation agentic reinforcement learning systems enable self-evolving agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.023088Z"},"links":{"cited_paper":"/paper/2607.01120","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:a906630120de0e170d9334441e6b120b185634565bd781a6fc62b6377bfe0b35","observation_id":"6a869fb7-4c00-430a-973c-afe7325b5047","resolution":{"observed_at":"2026-08-01T09:49:31.023088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T09:49:31.174986Z","title":"DAPO : An open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.174986Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:5fd4d65c7acd18cf5e13784cff7722b4125e9b8cf3d75570ba1a1fd040764d20","observation_id":"ae069bff-5684-4e86-9919-8ab9ea6f4ab6","resolution":{"observed_at":"2026-08-01T09:49:31.174986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:31.294037Z","title":"ProRL agent: Rollout-as-a-service for RL training of multi-turn LLM agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.294037Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:2f73aa36f3d772a6e221a0e5c66415bda69efff111a2441ff1679c782573a033","observation_id":"dd042aea-7619-4a94-ba34-9e89b795b488","resolution":{"observed_at":"2026-08-01T09:49:31.294037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11554","snapshot_observed_at":"2026-08-01T09:49:31.413822Z","title":"Relax : An asynchronous reinforcement learning engine for omni-modal post-training at scale","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.413822Z"},"links":{"cited_paper":"/paper/2604.11554","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:9b38f477b619e0245321964a6261125caa1be3cbcc4ec9f2150a81575a2c8046","observation_id":"7b849eeb-c909-49a0-82db-ab62884f9c63","resolution":{"observed_at":"2026-08-01T09:49:31.413822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T09:49:31.502294Z","title":"PyTorch FSDP : Experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.502294Z"},"links":{"citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:bbd8e7238b41a16cd53396d4b876b87b51e73d1ccaf8430a3897a4fda04b7060","observation_id":"265e3e5a-e547-4283-a722-a98add457ae0","resolution":{"observed_at":"2026-08-01T09:49:31.502294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-01T09:49:31.626939Z","title":"Group sequence policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.626939Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:b29eeb7d6ce4eafa41145a486d52ca3e12fe92c24f373f165a2d5d98a85ce836","observation_id":"37981a8a-1c61-49b0-ae8a-b08f35d2efda","resolution":{"observed_at":"2026-08-01T09:49:31.626939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-16T21:51:10.462948Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-01T09:49:31.726786Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.726786Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:72be82d058f82a2a7606b64e95db84c85545f8f0b16bf7654cfcf253131523d3","observation_id":"d4c6c9c6-09b0-4fdd-b732-68d274133d64","resolution":{"observed_at":"2026-08-01T09:49:31.726786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-08-16T11:12:24.160783Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-01T09:49:31.823521Z","title":"StreamRL : Scalable, heterogeneous, and elastic RL for LLMs with disaggregated stream generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:31.823521Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:5bd5dc2b615096dd187d77c96a0511bb742e18021b80b7550e0f09404477af23","observation_id":"f5568b77-114e-43db-aeff-8c01158870ee","resolution":{"observed_at":"2026-08-01T09:49:31.823521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.21653."}