{"as_of":"2026-08-08T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:842595900b4dcc27a132d87a08d2eb2c30d502ed9ec4c0ceb43ca5801978e72b","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:51:02.115809Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15610/citation-record","integrity":"/paper/2607.15610/integrity","json":"/paper/2607.15610/citation-record.json","paper":"/paper/2607.15610"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-01T22:51:01.855827Z","title":"arXiv preprint arXiv:2507.19849 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.855827Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:c9e3aae82ce76722f211b3f73f3bb27533eb898d984d280d735179dde1cd93fb","observation_id":"dc654b2b-d399-4ac3-bb76-dc3e5a7b49ff","resolution":{"observed_at":"2026-08-01T22:51:01.855827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T22:51:01.862640Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.862640Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:c5ddbc2a4016d3bc997d98121b636f12a722b8153a61f6afe254df0a0817e2a3","observation_id":"1af78faa-aa71-4e41-a3a5-aa37f897a72f","resolution":{"observed_at":"2026-08-01T22:51:01.862640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T22:51:01.867466Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.867466Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:5b65906c73d0abf9a8ee84bea3f79a140659464b554c7e12f185d2e586cb4105","observation_id":"d266afe9-452f-42fb-9f2e-54c0854fbfac","resolution":{"observed_at":"2026-08-01T22:51:01.867466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.872812Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.872812Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:d28e606f7dafa79442b9e2abc6d82f8fb95fd9e01c828be12c8847fe0f5a21e6","observation_id":"ceda4a33-923c-4f12-abc3-ca1097d64285","resolution":{"observed_at":"2026-08-01T22:51:01.872812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.878075Z","title":"arXiv preprint arXiv:2602.22817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.878075Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:30ffb2b7d99ea874860ea80910f7ce427daaac98a22ce67ccfb1ba54cb565161","observation_id":"11173a2b-ceb1-4a1b-944e-6b0beb524a81","resolution":{"observed_at":"2026-08-01T22:51:01.878075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.882565Z","title":"arXiv preprint arXiv:2509.06040 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.882565Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:c99c284411f31c7138426214966a3653aedc616030fb3bc471469dee8bb840d5","observation_id":"64c0fd4b-8384-4fa9-8a1b-84f79f30dfb6","resolution":{"observed_at":"2026-08-01T22:51:01.882565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.887952Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.887952Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:c308d7f48aca6fae693f5896bc1cd0a2088343a4009b21cdbeb88fb9c1da7401","observation_id":"b8af38c2-5456-4162-b519-7ed240284fe8","resolution":{"observed_at":"2026-08-01T22:51:01.887952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.892992Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.892992Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:5c713ccb7173b2c9c4d10095dd029564d1918b6cf2bfa09715b731f024cb716b","observation_id":"d980537e-6949-4b51-a9d2-f9032e0bee0b","resolution":{"observed_at":"2026-08-01T22:51:01.892992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.897762Z","title":"arXiv preprint arXiv:2603.03078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.897762Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:86c8f0ecdc5607014faf4912cf9207743ea357d4bad87a3928d3cfe0f0cfef66","observation_id":"c17c63ae-e387-4181-9083-421ea1a67109","resolution":{"observed_at":"2026-08-01T22:51:01.897762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.902422Z","title":"arXiv preprint arXiv:2511.16108 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.902422Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:033ad91ae55afef804e4bae4e7a160483de999c4d70bc479e3b6b33c7d113ec1","observation_id":"a1c6a846-5789-41fe-b98c-d59c96edafdf","resolution":{"observed_at":"2026-08-01T22:51:01.902422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-01T22:51:01.907282Z","title":"arXiv preprint arXiv:2412.09413 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.907282Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:44f32c69fa74b75694d02f699d1561bf8d58b91e5aec7a402eb107b336ec732e","observation_id":"bf37dc69-9ff4-49e7-966e-590967662b13","resolution":{"observed_at":"2026-08-01T22:51:01.907282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.912213Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.912213Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:0b2cdacc6c943902484a7c828ee089ca8bdda07a6daf8711d26fb2245ccad7ac","observation_id":"c3369599-5db8-429f-bf20-1b03f9917d68","resolution":{"observed_at":"2026-08-01T22:51:01.912213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.916601Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.916601Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:0dc6651d654ee0f1161f64fa9fba5227ada04b32b07ab9ce6be1f78c5820112c","observation_id":"3a644d5f-e4da-4824-9785-b8729c3db3eb","resolution":{"observed_at":"2026-08-01T22:51:01.916601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.921572Z","title":"arXiv preprint arXiv:2407.01476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.921572Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:73b2d638d3546c88d1b5a446606a01d038c244465d5d5f63275d821d1fc9baf3","observation_id":"4a037f56-8f47-4f3f-ad54-cee3b2c3fba0","resolution":{"observed_at":"2026-08-01T22:51:01.921572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11767","last_updated":"2026-05-19T07:10:33Z","snapshot_observed_at":"2026-07-30T12:49:02.330644Z","submitted_at":"2026-02-12T09:49:24Z","title":"TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11767","snapshot_observed_at":"2026-08-01T22:51:01.926088Z","title":"arXiv preprint arXiv:2602.11767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.926088Z"},"links":{"cited_paper":"/paper/2602.11767","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:8e3155edf6cb064b77eae9b9a7e9f142d116cf69cc308abff24bde158c107325","observation_id":"9cb62683-61db-48f2-b63c-25c1b718a0cd","resolution":{"observed_at":"2026-08-01T22:51:01.926088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.931380Z","title":"arXiv preprint arXiv:2603.02216 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.931380Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:22f81b458990137546610d8d8d04b40dc9afe03c310f66ff998c9ca33a1e37e3","observation_id":"76d710ab-ab6d-47ec-90a7-b16436448d20","resolution":{"observed_at":"2026-08-01T22:51:01.931380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.936445Z","title":"arXiv preprint arXiv:2510.14545 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.936445Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:81437c6375f6afa4a947161b34ba9908fc652ae02552a9b33982e04145223caa","observation_id":"0595bac0-09dc-473d-97ec-77345758cebb","resolution":{"observed_at":"2026-08-01T22:51:01.936445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.942075Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.942075Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:a499c9c2ed93d555a4b6e463b227e0a513ae93bf6e0a3787ec551de070517a56","observation_id":"31f50e61-ee74-448b-b5e9-749f725fe73a","resolution":{"observed_at":"2026-08-01T22:51:01.942075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17445","last_updated":"2025-08-24T16:52:37Z","snapshot_observed_at":"2026-08-05T16:50:00.721840Z","submitted_at":"2025-08-24T16:52:37Z","title":"TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17445","snapshot_observed_at":"2026-08-01T22:51:01.946686Z","title":"arXiv preprint arXiv:2508.17445 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.946686Z"},"links":{"cited_paper":"/paper/2508.17445","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:e41eb69fb3e57a908235f33d312f1f493dbf05d322568f5168791e212cf97206","observation_id":"fc1243b5-7dda-455d-a4a6-c4b49a9be0ef","resolution":{"observed_at":"2026-08-01T22:51:01.946686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.952267Z","title":"arXiv preprint arXiv:2512.08153 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.952267Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:412bc5f41441f6c1dd31caa80ac00ff854a4aea134443a25026de6a013b34b5c","observation_id":"053ca571-7a11-480d-a77e-2b38be2ce1ee","resolution":{"observed_at":"2026-08-01T22:51:01.952267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.957238Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.957238Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:a9f1ec4e904a63362e9a4eaed2dcc54df51d9b127e6b31dbc8b9677210863963","observation_id":"69dbb63a-ebc6-4007-9b44-5d513f8f1081","resolution":{"observed_at":"2026-08-01T22:51:01.957238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.961785Z","title":"arXiv preprint arXiv:2603.00296 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.961785Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:efa7a4b1bd2ff24bd56cef59256c3cfdbe773974515c5cd56da66adb42fba692","observation_id":"88e9ea15-985d-4c67-a444-d926277ba6d5","resolution":{"observed_at":"2026-08-01T22:51:01.961785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.966286Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.966286Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:5dc93f517f9be07e0329a6bbe0d3ad9d27709c97ab2b901e59abc6d22476e208","observation_id":"ca1c3646-9076-402a-b257-8b84b5901d4b","resolution":{"observed_at":"2026-08-01T22:51:01.966286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.970877Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.970877Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:b2903b3a449b1782dd07d8b250217cbd1d8f374105ad01fbb2caee6c268d496f","observation_id":"9687b349-3f62-4dc5-a68f-30c48f4e2a2a","resolution":{"observed_at":"2026-08-01T22:51:01.970877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.975760Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.975760Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:58b8f188888f09565aed927836e04e555245318ccb1fe91aa00135a9d081f8c8","observation_id":"409d0468-5740-4bbc-bd5c-738da42d02ef","resolution":{"observed_at":"2026-08-01T22:51:01.975760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-08T15:56:07.800611Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-01T22:51:01.981544Z","title":"arXiv preprint arXiv:2505.22312 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.981544Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:ffeabb3a38b7980c9427c45b3c89b2ad8ea6de46c80699dc55b7ebc4718d7857","observation_id":"bd2f6b3c-1eda-4706-b9e2-96700058a548","resolution":{"observed_at":"2026-08-01T22:51:01.981544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-01T22:51:01.986493Z","title":"arXiv preprint arXiv:2502.01456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.986493Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:f521099d76a266eb729f9327b534e882c1bb82cc439474543abc26793c8154b8","observation_id":"41784db7-cd49-4d7e-a3a2-c2d3b8546a4d","resolution":{"observed_at":"2026-08-01T22:51:01.986493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.991250Z","title":"arXiv preprint arXiv:2509.19199 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.991250Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:c1c6d48facd153c19e86522d359191b3cf2c696f82cf77c4763017efe94030f4","observation_id":"fe98da61-d19b-4833-80e0-609915bfd183","resolution":{"observed_at":"2026-08-01T22:51:01.991250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:01.996019Z","title":"arXiv preprint arXiv:2602.17025 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:01.996019Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:1316e8858f3a971a241efba43d41c2c2f321a2f3be53f530e5e0a15ed219b717","observation_id":"238ddf24-c58b-4aeb-9108-74853ddc1fc8","resolution":{"observed_at":"2026-08-01T22:51:01.996019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.000591Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.000591Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:dbdb59c7da5d4c1b10416819f15d1fe2b0856579aeee4dec87b68b536d90749e","observation_id":"a0dbd9bd-7ce5-405e-9bd5-b21bbd184ace","resolution":{"observed_at":"2026-08-01T22:51:02.000591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T22:51:02.005624Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.005624Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:0674115d02ceb3cffcc0cd0296816c9372721b3580be9f729ce2cdcaa70df120","observation_id":"e27a9318-3394-4ff3-b71a-92ec7e67eb52","resolution":{"observed_at":"2026-08-01T22:51:02.005624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.011033Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.011033Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:06e2b3c3abd4daa6dacea6f241831883d0d4d72388b5ea53f2fb416cc48a512b","observation_id":"c10ddbf0-bbf3-4b6a-9c03-05f6d232a9a9","resolution":{"observed_at":"2026-08-01T22:51:02.011033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.017289Z","title":"nature , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.017289Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:f307ff8cec105f9c2aedbb9798893294089ae5105c2e4ccc531f5d2641397172","observation_id":"9adaac36-5103-476c-a731-d4ea3d76b883","resolution":{"observed_at":"2026-08-01T22:51:02.017289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-08-01T22:51:02.022603Z","title":"arXiv preprint arXiv:2411.03817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.022603Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:a6a0b3d0963d424a45ea19235d7d85924c0fb2893bc612ead10a17603a1f474a","observation_id":"bd08aaba-361d-4a92-8b93-176bc1499bb7","resolution":{"observed_at":"2026-08-01T22:51:02.022603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-01T22:51:02.027774Z","title":"arXiv preprint arXiv:1606.01540 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.027774Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:90b0adbc8f25a9d504c93756621a320af846258de41ca576059930e756ed7557","observation_id":"ea0a0d05-9fda-4bad-b6ae-6be651077ec0","resolution":{"observed_at":"2026-08-01T22:51:02.027774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.033389Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.033389Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:cf4ebca17f5af74b13bdb2576110c4966b9a8104a2051150ebf31f218f246a67","observation_id":"abd75e59-6196-4652-8578-6a365dae4207","resolution":{"observed_at":"2026-08-01T22:51:02.033389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07164","last_updated":"2025-04-09T17:55:19Z","snapshot_observed_at":"2026-08-07T16:07:06.150702Z","submitted_at":"2025-04-09T17:55:19Z","title":"R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07164","snapshot_observed_at":"2026-08-01T22:51:02.038204Z","title":"arXiv preprint arXiv:2504.07164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.038204Z"},"links":{"cited_paper":"/paper/2504.07164","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:252ce429cbc7f1d0cd1aee39b2ea680bf986d7dfa591b81c69000005f60aa037","observation_id":"4af383bc-1e81-4ed7-9655-97be86f4b61d","resolution":{"observed_at":"2026-08-01T22:51:02.038204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.043466Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.043466Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:b2e1998568ea2040f3f63f8d0d778ec8375be988d9dbd06cd982311bc53541b5","observation_id":"9420448c-6ad6-4882-a529-04e6680b56b1","resolution":{"observed_at":"2026-08-01T22:51:02.043466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-01T22:51:02.048732Z","title":"5-coder technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.048732Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:56f00e4a18107e6133ce1c42e9e7a39440a70e2f17682b2c6e73828cca5ea842","observation_id":"e74c68b8-fb29-4fe6-8ef7-7daac7c193c5","resolution":{"observed_at":"2026-08-01T22:51:02.048732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.054044Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.054044Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:d1380496881a1b275579eeabfb481901c57f0b0ac7e2326c9ea384ed38cb8259","observation_id":"3dde4b1b-2356-4576-b3ab-1c4318d0a4e3","resolution":{"observed_at":"2026-08-01T22:51:02.054044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T22:51:02.060253Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.060253Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:674c06637cdb631ada6c3ecbbb87fd5c6bf779be09f32ac170474fcb1fec2a20","observation_id":"bd4a0d4e-9a80-47d5-8b47-16f9224ae776","resolution":{"observed_at":"2026-08-01T22:51:02.060253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.065858Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.065858Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:1cebe1c43d335d6ab9dfcc3e7fc3838f77bcbab800d8530075846df8dac92149","observation_id":"275992c1-7290-4e6d-b0ca-31e35f9d3b1c","resolution":{"observed_at":"2026-08-01T22:51:02.065858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.070415Z","title":"European conference on machine learning , pages=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.070415Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:61b346f81de7a5fa803ca521e6e1a7d45eba0d0f705a9de447a9781a641c6833","observation_id":"c977a3cf-2263-4106-a43a-a5e1645285b2","resolution":{"observed_at":"2026-08-01T22:51:02.070415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.075513Z","title":"2016 , eprint=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.075513Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:6511251665c76ec8a34c4e15508a3dd53f89e5203c92926571cdc5ce53a0b298","observation_id":"09524048-5675-44be-8290-323d18595cf0","resolution":{"observed_at":"2026-08-01T22:51:02.075513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.080472Z","title":"2018 , eprint=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.080472Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:cbbc7521ef24a7f740f879c1592165951c77ec0b484a76250e33213cb82eac68","observation_id":"8d089323-bf1f-4a43-af2c-bc1f7304286b","resolution":{"observed_at":"2026-08-01T22:51:02.080472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.086794Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.086794Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:25e3124110542d0a6c76e957c488cf452a6f6b38fd03c5d35fa0b3c07c18e039","observation_id":"10d9657f-9991-4954-9eb6-098bd0580983","resolution":{"observed_at":"2026-08-01T22:51:02.086794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.092156Z","title":"arXiv preprint arXiv:2510.24302 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.092156Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:ce6d485247ccbcc0dcc5103376843cc5d9e13d7fe9184a14ad882fa13195ed7a","observation_id":"7381c2bd-ed72-49b0-a58e-91b207009301","resolution":{"observed_at":"2026-08-01T22:51:02.092156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-01T22:51:02.096738Z","title":"arXiv preprint arXiv:2210.03629 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.096738Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:f628945f4000b726da355a04cf114ff2e66e032cca55d84fbad735f1ad935f0d","observation_id":"2a0dc8ef-ad46-42da-8a6a-bbb4f8074e52","resolution":{"observed_at":"2026-08-01T22:51:02.096738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.101875Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.101875Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:a4738b211d66218012cc4826945805dbeefadf1a96124d7fbd666cee7ff59f29","observation_id":"256e16d3-4bb1-4f15-94ee-d41e4d810f61","resolution":{"observed_at":"2026-08-01T22:51:02.101875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.106487Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.106487Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:2a03ed0187e7fe494531c42fb5b178cc2ac2a4a188a8a48c8c13d9468049a0de","observation_id":"ea78f280-d06d-45e1-8314-7e893df889d2","resolution":{"observed_at":"2026-08-01T22:51:02.106487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:51:02.111074Z","title":"Findings of the Association for Computational Linguistics: EACL 2026 , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.111074Z"},"links":{"citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:664e446f1beacaced9226f89d41cf5d04ce77592f87c9360292cb2a922ad9442","observation_id":"f6dd1b67-63af-4ea8-b0ae-c701f91f2835","resolution":{"observed_at":"2026-08-01T22:51:02.111074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-07T13:45:29.055916Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-01T22:51:02.115809Z","title":"arXiv preprint arXiv:2505.20732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.115809Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:d9956fe0348d2a14c5a5bd024e4ae497170667b9436d41a1f6708f5b6d02eb50","observation_id":"9ff0fa1f-36fc-4df7-9af0-d5877a854285","resolution":{"observed_at":"2026-08-01T22:51:02.115809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.15610."}