{"as_of":"2026-08-07T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd10f8a8e7f6317d80a1dc280580abdd30235cb97409656778a76ce1101706b4","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:08:25.628815Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:04:01.975680Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-08-05T20:04:01.975680Z","title":"Treerl: Llm reinforcement learning with on-policy tree search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11356","last_updated":"2025-08-29T08:04:20Z","snapshot_observed_at":"2026-08-05T20:04:00.659293Z","submitted_at":"2025-08-15T09:49:14Z","title":"ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:01.975680Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2508.11356"},"observation_digest":"sha256:8972bc09046ec3cc6deefe234bcc8538956950531465db3c8240244f12c66d18","observation_id":"d4741241-e8f2-4fa6-b6c2-25f2c4592963","resolution":{"observed_at":"2026-08-05T20:04:01.975680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:39ba69f69d306d686714499394e97b7eb3dec00bf91cbf48280b33098bc0aed9","observation_id":"41286303-b7db-49f1-89ba-016153a2aaca","resolution":{"observed_at":"2026-05-18T00:05:31.659995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-08-04T11:11:11.329062Z","title":"Treerl: Llm reinforcement learning with on-policy tree search.arXiv preprint arXiv:2506.11902,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06672","last_updated":"2026-05-25T01:59:00Z","snapshot_observed_at":"2026-08-04T11:11:09.166918Z","submitted_at":"2025-10-08T05:53:56Z","title":"XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T11:11:11.329062Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2510.06672"},"observation_digest":"sha256:9b82466dac6c3b514b1422e3ae4abd31006a8974015770897f536e8a0cd47b7d","observation_id":"55afe15c-6588-48c6-871e-1df5cc9c14b4","resolution":{"observed_at":"2026-08-04T11:11:11.329062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2511.00413","last_updated":"2026-04-23T16:13:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-01T05:56:49Z","title":"Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T02:04:46.559881Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2511.00413"},"observation_digest":"sha256:1644dc2140378cbf2f8e82b5e881fefc5e512796717654543418451048f7eb4d","observation_id":"bc205017-7caf-4ec6-b1fc-0c19b7228b78","resolution":{"observed_at":"2026-05-18T02:05:39.076738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-08-03T05:29:27.901205Z","title":"Treerl: Llm reinforcement learning with on-policy tree search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02150","last_updated":"2026-05-27T15:07:04Z","snapshot_observed_at":"2026-08-03T05:29:25.753498Z","submitted_at":"2026-02-02T14:27:02Z","title":"ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T05:29:27.901205Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2602.02150"},"observation_digest":"sha256:019cbd32ba434ef7c039a43c77ef7437e63f8d269b875f9954971c48ecf72661","observation_id":"223c20ca-91da-4c58-9739-b077b2209246","resolution":{"observed_at":"2026-08-03T05:29:27.901205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2604.10827","last_updated":"2026-04-12T21:49:13Z","snapshot_observed_at":"2026-08-05T18:01:30.449144Z","submitted_at":"2026-04-12T21:49:13Z","title":"Your Model Diversity, Not Method, Determines Reasoning Strategy","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T15:16:30.448400Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2604.10827"},"observation_digest":"sha256:bb636c5b7d85e7944330e5d8d3d2d9174e8ffeaa6d8db841fc2f9207c63044bb","observation_id":"f59c23a7-3b89-4b5d-97a9-95dbc550f765","resolution":{"observed_at":"2026-05-11T10:56:02.900863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2604.14518","last_updated":"2026-04-17T01:58:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:20:06Z","title":"Mind DeepResearch Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T11:46:49.178896Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2604.14518"},"observation_digest":"sha256:1e9b7a053ed1a44b9d9f80bf63f5dceacc7fa7f7b0b896e0ecbd1d9b80dc75a2","observation_id":"871d0549-81eb-41e7-bc1d-f3d15e446620","resolution":{"observed_at":"2026-05-10T11:50:20.510822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2605.06200","last_updated":"2026-05-07T13:09:31Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:09:31Z","title":"A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T10:41:46.675257Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2605.06200"},"observation_digest":"sha256:af3e424d01b873793f8f1c09856b6375ef1dd9cf17d5e705cbcd65bbd73be4aa","observation_id":"d84b49d2-2575-42a7-b3b7-89b17e034bd9","resolution":{"observed_at":"2026-05-11T19:56:08.732519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2605.08315","last_updated":"2026-05-08T14:26:40Z","snapshot_observed_at":"2026-07-31T18:56:01.160228Z","submitted_at":"2026-05-08T14:26:40Z","title":"Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:58.315109Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2605.08315"},"observation_digest":"sha256:c9bbc9c1215d6ad0fabb9b926ffa3a760d18151b993da64251ad1e5c2af869e6","observation_id":"9dae7e03-dc10-483b-afb3-bfb4057ee305","resolution":{"observed_at":"2026-05-12T08:41:24.001119Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:83931d7b9deed3751ed4e5deb12cffd08649db58ec07c75210b3737259ddbd5f","observation_id":"d66b4fc2-8352-4580-91ae-06aaccc2e7c2","resolution":{"observed_at":"2026-06-29T08:03:14.272895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:c169451dc84757f94d92758b777464479f08128917303cce21c27643e17a31ae","observation_id":"6bdbc50d-42f7-4a2e-9bfc-6124572ea550","resolution":{"observed_at":"2026-07-01T20:56:13.465370Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2606.03489","last_updated":"2026-06-02T11:07:20Z","snapshot_observed_at":"2026-07-06T23:43:46.458792Z","submitted_at":"2026-06-02T11:07:20Z","title":"Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T09:40:35.258818Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2606.03489"},"observation_digest":"sha256:19afeed0fd787d91eff48ebe3e0c1ba54f87e2168e83ecc030b2fc6bc4991162","observation_id":"42992776-2f8f-409a-aa5d-dd9f01562b47","resolution":{"observed_at":"2026-07-02T03:46:33.124385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:745631442269ff8f975da91d0c21d911a2a8ae031d2aa7581259e27652c197e4","observation_id":"54e78ec6-2080-409f-a345-eaf32746f106","resolution":{"observed_at":"2026-07-03T20:38:56.077665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:b78a9db4f859977108771ad9694e2d355eb40c38a3d4c0a0099dcf7049660f81","observation_id":"0e55e482-269d-4501-83d7-1fdd41060ce4","resolution":{"observed_at":"2026-07-04T08:09:40.748310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2606.26453","last_updated":"2026-06-24T23:28:09Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T23:28:09Z","title":"Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T01:12:04.486570Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2606.26453"},"observation_digest":"sha256:534e33c7f28debe5ab20b2bba213e68c022e1c90e8e7752372bc12dc66730277","observation_id":"56d2bf61-7fb1-45cb-9a2a-53bbd9ab9731","resolution":{"observed_at":"2026-07-04T15:59:56.473477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2607.05378","last_updated":"2026-07-06T17:55:12Z","snapshot_observed_at":"2026-08-06T19:27:08.415859Z","submitted_at":"2026-07-06T17:55:12Z","title":"CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2607.05378"},"observation_digest":"sha256:03121cd8e2045ef44333600e932264552466f4c57f56f868538414b77f42d935","observation_id":"e6123da0-4012-48b2-8d19-fb1ac55d7222","resolution":{"observed_at":"2026-07-07T14:03:48.459093Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11902/citation-record","integrity":"/paper/2506.11902/integrity","json":"/paper/2506.11902/citation-record.json","paper":"/paper/2506.11902"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T01:08:20.099844Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.099844Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:6f7fedf47f6713faceeddc5dd9bf91f9abe9370694e0ccac3dda17765cbfeba9","observation_id":"f9000ba0-c45d-4c5e-bc4e-749e5da8624e","resolution":{"observed_at":"2026-08-07T01:08:20.099844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:27.977417Z","title":null,"venue":null,"work_id":"4046cbbc-298d-46cb-881d-b467d7a4e3aa","year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.171800Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:2123f048cb50700742f3f50d35534297d6ae4cc5a48e761159c3a5879fa0526e","observation_id":"35c08fa4-6399-477d-bc3e-b7597da039ab","resolution":{"observed_at":"2026-08-07T01:08:28.054101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:20.268467Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.268467Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:cab4a604de7c113de30fcc3c6d8184d8c63cf57384078128941c5d83d4cf85d1","observation_id":"548c0e0d-4b53-40d9-8dc8-97d8b7c4fd0f","resolution":{"observed_at":"2026-08-07T01:08:20.268467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-07-06T18:10:29.627336Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-07T01:08:20.439050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.439050Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:1a663dc68666c420b469fac7c9f1ed9234fad9c84d76b1b7cc5af1071b1b22e5","observation_id":"37859dfb-bf4d-40f2-b6a5-eede338bbcf6","resolution":{"observed_at":"2026-08-07T01:08:20.439050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:27.766884Z","title":null,"venue":null,"work_id":"12296a4a-04a9-4ba8-b9ce-2dd411fe0e14","year":2021},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.554819Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:660e8fe01da0ceb3d9400363a08139fedde565f1c74dc510cd60f602900822fb","observation_id":"0474d1d2-34ee-482b-892b-0c3854886c24","resolution":{"observed_at":"2026-08-07T01:08:27.863940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T01:08:20.672429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.672429Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:766cc6dd9d32c22b3ff1eafc642347ee2fa62e34ebf37d741e53a7136c3fb59d","observation_id":"d0808632-c636-405e-bf7f-551e4a35ad44","resolution":{"observed_at":"2026-08-07T01:08:20.672429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T01:08:20.750335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.750335Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:bd8140e026c5ffd6f8e577089cc459016194871a7e88dcb398c101666d0674dc","observation_id":"c54a79fa-7e5e-42a8-85a3-f7797b28d389","resolution":{"observed_at":"2026-08-07T01:08:20.750335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T01:08:20.862537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.862537Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:9f8b7f7daba017d5312951e6c8f769c37736eb64a91afe0e629b2855da164fed","observation_id":"d7d0511f-bc7d-4b3f-9910-c310f4ad58b5","resolution":{"observed_at":"2026-08-07T01:08:20.862537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T01:08:21.018108Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.018108Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:848ce5ddcc44743bc330faed468b147cc56d8af4110fd0e0c150341b059c599d","observation_id":"108809f1-b85c-46a5-b31e-70b41564c3ba","resolution":{"observed_at":"2026-08-07T01:08:21.018108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T01:08:21.132363Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.132363Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:c1e4bb6871c6a7c47f6b32b1b10a638825644165f07cf65ca7066d931e90cc0c","observation_id":"db28df58-6259-4ddf-81cc-9f7145447025","resolution":{"observed_at":"2026-08-07T01:08:21.132363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T01:08:21.246828Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.246828Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:3b062103b35cc58a52a994e9f0836d32b76460a20785fc6845820c64c9ab4536","observation_id":"59be97ce-94dc-4111-8a38-12fe2946a9f4","resolution":{"observed_at":"2026-08-07T01:08:21.246828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T01:08:21.368779Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.368779Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:e46b8a4f45e3765beea47458b09feab070414185d03978f3d9b23927160b6d39","observation_id":"e23d2773-23fa-4156-87aa-225ec2af809b","resolution":{"observed_at":"2026-08-07T01:08:21.368779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:21.489039Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.489039Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:cf667bcdc87c7103830589474fbe66d2c16b8cbdd72cdb41a3cbcf5683bccf84","observation_id":"2a69b891-6729-46bb-b446-d107a225d97c","resolution":{"observed_at":"2026-08-07T01:08:21.489039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-02T09:44:45.484509Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11651","snapshot_observed_at":"2026-08-07T01:08:21.609464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.609464Z"},"links":{"cited_paper":"/paper/2501.11651","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:0abcff25b04b3beed4384c632bf856e26930393990527af28656626456f42930","observation_id":"3abbd6aa-3f04-4587-8587-14516d4153ce","resolution":{"observed_at":"2026-08-07T01:08:21.609464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T01:08:21.704002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.704002Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:846a635e4e9afb7e2ea8de6e55a7d0b8621852ed86ffb0da51d274d89b6b8cd2","observation_id":"b173984c-824c-4026-bc23-9654b25d5a29","resolution":{"observed_at":"2026-08-07T01:08:21.704002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T01:08:21.838257Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.838257Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:46430f8b14dff8f6dfff8f0bf5f39ed1b8bc15cd4afdb759a3b9d7966d94041e","observation_id":"ebe55ede-7678-4f2c-8c1e-c65490ac9874","resolution":{"observed_at":"2026-08-07T01:08:21.838257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:21.937967Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.937967Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:f1c6be2499708d6df0dca28766c1fe59e122c298de6c36e8c781a9ca0732f5d0","observation_id":"2a630102-fced-4a9e-8dd4-3ff21196ca73","resolution":{"observed_at":"2026-08-07T01:08:21.937967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:27.591708Z","title":null,"venue":null,"work_id":"e831ffbc-2716-48b5-be76-14853874e14e","year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:22.107828Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:acc5a3f828afccc2be3c8987b54390f9b9a4da88ff9c6146aa9ef0bf71208ee5","observation_id":"4e3ceeda-aeb0-40d4-8a56-5a201fa75cd1","resolution":{"observed_at":"2026-08-07T01:08:27.647972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-07T01:08:22.249034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:22.249034Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:fa519946fd75b0b0d28a19673db14e6c10d2a54b2081a1f453fe349ed1454b6f","observation_id":"5f105cbc-8e7c-4f4e-8a0e-b94a0bd87094","resolution":{"observed_at":"2026-08-07T01:08:22.249034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T01:08:22.406148Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:22.406148Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:4f612fe3ea07c2d907161d50b34b08dc2b27cac9bdfc7788c0ff17c32c588691","observation_id":"bd96f29a-1019-4ae5-b74b-1fc215bc35c9","resolution":{"observed_at":"2026-08-07T01:08:22.406148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:27.406461Z","title":"Let's verify step by step","venue":null,"work_id":"fc1663d1-a88d-4983-b77e-c26b3271ca88","year":null},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:22.548614Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:5bacefb3359c48092ee53a511189ca33fbb0e600f6700bef76dca0d585a08993","observation_id":"b3a8ffeb-dcb2-4621-ab00-4827b7660a87","resolution":{"observed_at":"2026-08-07T01:08:27.514928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08291","last_updated":"2023-05-15T01:18:23Z","snapshot_observed_at":"2026-07-06T15:27:02.376191Z","submitted_at":"2023-05-15T01:18:23Z","title":"Large Language Model Guided Tree-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08291","snapshot_observed_at":"2026-08-07T01:08:22.626559Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:22.626559Z"},"links":{"cited_paper":"/paper/2305.08291","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:382aece7b00c33179c16b719c06861525622acacc3c1616b39bd580882099e20","observation_id":"17994dfb-b49c-4538-9ba7-4905d912477d","resolution":{"observed_at":"2026-08-07T01:08:22.626559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-07T01:08:22.745145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:22.745145Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:b366167a9feb1863919d3dcf2d1212e6259e0ba6686cdbceb8c90807b07cab5e","observation_id":"5acb4d0d-a41c-4560-b514-bfffe22778e6","resolution":{"observed_at":"2026-08-07T01:08:22.745145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T01:08:22.851720Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:22.851720Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:815c6dcb97d18f1e27f450bb6c7ebec21b808ac9d6aec82b7558df8e128357ab","observation_id":"0a1ef31d-1ec5-4bb9-be91-38cada151174","resolution":{"observed_at":"2026-08-07T01:08:22.851720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:27.226672Z","title":null,"venue":null,"work_id":"cee497bb-3ebd-43ac-a374-2902cb19b713","year":2022},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:23.007752Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:809dafc44c9a90fa43533c29485d59663f1f1cfccdab4107cdbf0073f6880793","observation_id":"360f76b9-4154-482c-8917-9fd6eac0f072","resolution":{"observed_at":"2026-08-07T01:08:27.334489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:27.050042Z","title":null,"venue":null,"work_id":"636af62a-2aa7-40e2-ae48-488baf9ded8c","year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:23.112005Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:debbceb35978396bbf4ba283a76c53fdbba77a8ed823454954fc76720a3ee1d6","observation_id":"de9385a3-4caf-4419-9694-4bcc5477f941","resolution":{"observed_at":"2026-08-07T01:08:27.175293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:26.838972Z","title":null,"venue":null,"work_id":"7ba211d5-3397-413c-9539-b7b84852e2c0","year":2022},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:23.214596Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:b4bda675b6b1a4da5ee5b99d4983c3676b591babd72883f05d796517e2cf82e6","observation_id":"01541c63-caf3-4805-886b-c1a41b8a9ab9","resolution":{"observed_at":"2026-08-07T01:08:26.901684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:26.734454Z","title":null,"venue":null,"work_id":"d27a0e35-04ed-4033-b9b0-d148020ffed9","year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:23.430414Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:e46d93021f83b0b051a1d7bb9bb6070c8085e768c73b0e22aa9c416c249b72b4","observation_id":"68c28502-06e4-489e-a638-0b5bf15d708a","resolution":{"observed_at":"2026-08-07T01:08:26.772305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:23.607958Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:23.607958Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:c327c87c801458aa3533ce51ec10757343a339064264d5e39dd4207739415bb9","observation_id":"e8512c18-f4aa-4c11-a56c-5ce891616b30","resolution":{"observed_at":"2026-08-07T01:08:23.607958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:26.587387Z","title":null,"venue":null,"work_id":"d00a4ca8-121f-42ee-8e18-09da0f6ca0c1","year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:23.744564Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:5670151c504cf8f8c9768f93f942b04519582b01554587ec7064bb0db64316c6","observation_id":"ba6f07d1-6cbf-4aca-af99-7d7ed57b24b3","resolution":{"observed_at":"2026-08-07T01:08:26.643901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T01:08:23.919121Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:23.919121Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:ab86ab0103581ac0063cde1a1782a2809b470ceec129f99bcf1013f52c7f5407","observation_id":"b2ed575e-2c68-4be3-bc27-733b2bc5dc5a","resolution":{"observed_at":"2026-08-07T01:08:23.919121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T01:08:24.026164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.026164Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:bb7e606220d5730cfeab69389ecbaa64bdcab74a37e551940d9e63fbc6714e9a","observation_id":"0d289415-6c0c-42d4-8ffd-a3037d2b62e4","resolution":{"observed_at":"2026-08-07T01:08:24.026164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T01:08:24.164924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.164924Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:5eec04c3d4bbceb7da0c3bcdb02658f8969effd429fb065ab05db21934ff2185","observation_id":"6a7f969b-4cb2-4938-ad60-c9dd3bfae858","resolution":{"observed_at":"2026-08-07T01:08:24.164924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-07T01:08:24.323361Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.323361Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:6a7f56bbfd8fc25a39c663bb8f746e2e608789025f6946e43c47b7efa566cd25","observation_id":"c8f2eee2-1bb1-44aa-bead-6ad9de2b6459","resolution":{"observed_at":"2026-08-07T01:08:24.323361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:26.417239Z","title":null,"venue":null,"work_id":"2f43f71c-2c74-47ed-a965-fb826637b34f","year":2022},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.412522Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:60f34c6e0bdb919662013a3a9eac457634d7451951d8d138488369e6ca27ec3e","observation_id":"c42a747e-1287-4068-9841-9947be8584b2","resolution":{"observed_at":"2026-08-07T01:08:26.497716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T01:08:24.493167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.493167Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:2115a8c82ab145a00bc22001d501f1df9052eda3b26bfc49fdd9ba381633633f","observation_id":"cd4fc2bf-5f38-4144-b847-aa1bc12bed1f","resolution":{"observed_at":"2026-08-07T01:08:24.493167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T01:08:24.572387Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.572387Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:3bb07aa513c3f7aa341a3858e28dd32f36ef9907ca7367f22a7e587054142b81","observation_id":"6ecd0436-4be8-4c61-a716-91e27d955e8d","resolution":{"observed_at":"2026-08-07T01:08:24.572387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T01:08:24.708005Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.708005Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:9335ab4194c9b1fa32b73f7a4580b67b4385ac09daa278eea5288ff5f7429072","observation_id":"b6ef6b9a-dc9e-4d59-87dd-d15515afa047","resolution":{"observed_at":"2026-08-07T01:08:24.708005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T01:08:24.775505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.775505Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:ee6ee658e858bd51319252458a67692a13d9d902d0e4d0c9dc5df7e2b39e4f19","observation_id":"536beee4-e060-470b-a045-4f6a9fec0f9d","resolution":{"observed_at":"2026-08-07T01:08:24.775505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:26.274394Z","title":null,"venue":null,"work_id":"2035a908-1a40-472b-969c-6e53ee0b74ad","year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.889023Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:2cb2fb1ab2b0f058a693c01a9df3bc5439d19bfda240ee35971faa2e981589ec","observation_id":"a76676cf-d4fe-4126-96ea-2073f65e973b","resolution":{"observed_at":"2026-08-07T01:08:26.349520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-07T01:08:24.959999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:24.959999Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:2fe44fa25eea237a533fae59d956dbe601496985380ce81932b8c198b6f90465","observation_id":"f6e930f5-f5ae-4d25-b27e-4f1f5de066af","resolution":{"observed_at":"2026-08-07T01:08:24.959999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-07-06T18:08:09.361079Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T01:08:25.027204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.027204Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:0cda5988a1a13764e5a0c9ed2eb464b3ad508cd0e86bfc4234dbe105204b5a43","observation_id":"23e05b3c-5c67-4de9-af7d-a2f197b49a0f","resolution":{"observed_at":"2026-08-07T01:08:25.027204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T01:08:25.129553Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.129553Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:68a3f350981cc9eb42140c24e3b07dde58c7c688b0dcadba300664c97329e738","observation_id":"fb7408bf-4e5e-4c70-91be-f632880a6d68","resolution":{"observed_at":"2026-08-07T01:08:25.129553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T01:08:25.265647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.265647Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:67d1bbd775359bce853ca0a250ee054551007e8dbc72aa05134ae729e516b31a","observation_id":"835d2202-c34e-47ce-8dd7-cbb7280c706c","resolution":{"observed_at":"2026-08-07T01:08:25.265647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T01:08:25.355982Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.355982Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:311a6b1b5f6ff4be72cd44fb5959de78cae23851cfc90c66d2e52edc291e756c","observation_id":"78f5cf1a-7238-481a-aaac-6960c8b4c934","resolution":{"observed_at":"2026-08-07T01:08:25.355982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:25.428290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.428290Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:6a3178925e281318a8aa9ac5177c1de50be5e2124c0b2ec33b8bdf7dcf578737","observation_id":"6eb98aae-9e09-4c8b-a53c-e63acfe06a87","resolution":{"observed_at":"2026-08-07T01:08:25.428290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-07T01:08:25.510840Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.510840Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:0013c0c60af75754c4a854fe657a7516702ad223864ee08def7a6d18c39b6b81","observation_id":"377648b2-6d7e-47a0-a253-9d73c9182140","resolution":{"observed_at":"2026-08-07T01:08:25.510840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:25.577547Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.577547Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:f828f626d2b29ce4dcba24c98974331065fb63455006bae3a16a71324bae952f","observation_id":"ee4802b8-704c-4ce6-ba17-55dc5ff8dbb2","resolution":{"observed_at":"2026-08-07T01:08:25.577547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:08:25.628815Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.628815Z"},"links":{"citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:916e9c5c0feac16f180f4fd19edd52d9293ecc0aa6fbab450a82946e73ebe49e","observation_id":"b5960a35-e0d5-46f2-9186-5756badda292","resolution":{"observed_at":"2026-08-07T01:08:25.628815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 16 inbound Pith citation observations for arXiv:2506.11902."}