{"as_of":"2026-08-15T21:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6ef185b2d46a7cfc51edc90d46296cdf757c7d008555ea9efa8df71be236270","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T13:01:45.049174Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:53:52.763644Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:53:52.854862Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06223","snapshot_observed_at":"2026-08-04T13:44:42.254343Z","title":"arXiv preprint arXiv:2607.06223 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-13T06:02:04.863233Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.254343Z"},"links":{"cited_paper":"/paper/2607.06223","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:c435fe80f13cca47f98387a6436ae48f69193ce43505a1febe132325643e4839","observation_id":"601c01fc-f827-46be-80ab-f4ef28a8bd95","resolution":{"observed_at":"2026-08-04T13:44:42.254343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"cited_work":{"arxiv_id":"2607.06223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.06223","snapshot_observed_at":"2026-08-06T05:53:52.854862Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","venue":"cs.AI","work_id":"4ed45571-b256-481e-8d39-5f6d7a0885ce","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-14T14:09:06.311070Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.763644Z"},"links":{"cited_paper":"/paper/2607.06223","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:83b93b9d27d027c7885646f71825c086c1b6328169b5d3e8cf08300dec4b93e7","observation_id":"454f7f37-0091-4243-aba9-34b22322ce7d","resolution":{"observed_at":"2026-08-06T05:53:52.858284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.06223/citation-record","integrity":"/paper/2607.06223/integrity","json":"/paper/2607.06223/citation-record.json","paper":"/paper/2607.06223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.059598Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":"3b714b71-fd6e-4be0-85b2-b819da87c44f","year":1901},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:d0450cf4a3dc7368ba00fe15481385ea1d409503273a39258fb80cdbf2953242","observation_id":"653bad21-17df-4070-bd47-d3474750dee1","resolution":{"observed_at":"2026-07-08T13:04:57.061259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:25:13.143518Z","title":"Palm: Scaling language modeling with pathways.Journal of machine learning research, 24(240): 1–113, 2023","venue":null,"work_id":"cc4b45b8-ca25-4606-88e6-6573b0f8b3b4","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:3bed213e69fb943bb5f1b97771e933cc8a5166c956c6f2b12c2c9557329012c4","observation_id":"32b1664c-bd0d-4432-91aa-a452b6374cef","resolution":{"observed_at":"2026-07-08T13:04:57.083108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:9636c92221ae7f53d7b576fb2c49f76d63ccee33c683ce8876879c3f302aa115","observation_id":"f1d3c3ec-21cd-4711-8191-2f83006a4011","resolution":{"observed_at":"2026-07-08T13:04:56.738338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:1b19a099e49269a2a5add24c15063aef32efd00f60c9dbcad43885aa9db2b6f8","observation_id":"eecfc933-8c46-4f11-83ac-80370982ca02","resolution":{"observed_at":"2026-07-08T13:04:56.701696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.615980Z","title":"Toolformer: Language models can teach themselves to use tools.Advances in neural information processing systems, 36: 68539–68551","venue":null,"work_id":"b18d1b4f-f40e-4afe-aaf9-d74b9349d25e","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:59fcbaa6600e02ecfc9bde88056035b4b53ab69db930d20ad4ec42e2e79f1e1c","observation_id":"6eb9376e-9dd2-4705-9c20-335efced767d","resolution":{"observed_at":"2026-07-08T13:04:57.094150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:30cf0ad77b54af99356e5976ce650462ac853041624e4ef7ded6984d8d365df3","observation_id":"59fbeac2-527b-467f-85be-ae71a3a1a923","resolution":{"observed_at":"2026-07-08T13:04:56.742129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-15T20:12:18.032530Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"cited_work":{"arxiv_id":"2506.18096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18096","snapshot_observed_at":"2026-07-08T13:04:56.715325Z","title":"Deep Research Agents: A Systematic Examination And Roadmap, September 2025","venue":"cs.AI","work_id":"ac5cfd30-9bde-4b94-9dd3-65ec5ef6056b","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2506.18096","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:373d895ab0c5d6e3e417ba548b63b0dd89c8aedb96c3ad400b5211acbd522339","observation_id":"1a918ce6-6f2d-4f62-853f-055961e0244e","resolution":{"observed_at":"2026-07-08T13:04:56.716778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.090614Z","title":"Searching for best practices in retrieval- augmented generation","venue":null,"work_id":"b57ee23f-8efd-4964-8879-e6ea6f6b0f52","year":2024},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:6d8fa837232a59e4e3c756c194a22802aeb6aec3ffc7abc6ae571a97ef2aac65","observation_id":"3555b2ba-7936-4a1e-b79c-7e9d3df39f71","resolution":{"observed_at":"2026-07-08T13:04:57.091978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.094889Z","title":"Search-o1: Agentic search-enhanced large reasoning models","venue":null,"work_id":"0c3cf575-e9bb-46c5-81b2-b8b834322cd5","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:d7851f68404c1b773dc457f58c3581bc6f376157a8daabaf628b250421c8ffa0","observation_id":"b38c324e-277e-4cc6-846a-2aab5023bafa","resolution":{"observed_at":"2026-07-08T13:04:57.096554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:0586c54fb7d688d2dc8129cd48c850ac8b607131b91e2b0bf6cc226701b25af7","observation_id":"6d71ee68-0fae-4634-be81-d148ace315d6","resolution":{"observed_at":"2026-07-08T13:04:56.721618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:604e7eaf8d17bf59d717f29006faa84c48d418a8f751a61ace10385f83ef7cbb","observation_id":"cc264f8a-82bf-408a-8192-331fc975c8ec","resolution":{"observed_at":"2026-07-08T13:04:56.719157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:10a76160071d46675880184d9474854f4d10b7560c6a3d1dd2dee1f9ed695605","observation_id":"8f58128f-f53e-43de-9396-3f476fc3f513","resolution":{"observed_at":"2026-07-08T13:04:56.711606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:2e8b026d2cb225bb304ab59b6a768bb0891b80cb7d150205451307db5123626d","observation_id":"ea69393f-50df-47b8-9222-cda18a03251d","resolution":{"observed_at":"2026-07-08T13:04:57.085272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:37a8a72aa999f9386f280aefe7c8a32983e61d2159696e22f063b3f0b71cbc96","observation_id":"5db26127-3237-46a2-8a55-3a47aa4ea8f9","resolution":{"observed_at":"2026-07-08T13:04:56.723999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:f610747a962924a38584e6ee43bf6c0c204599cbc37990f7a5e94a808b9c2af4","observation_id":"924d65f0-371c-4ed0-9a18-57c48f7c031f","resolution":{"observed_at":"2026-07-08T13:04:56.714142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:36.769512Z","title":"Information gain-based policy optimization: A simple and effective approach for multi-turn llm agents","venue":null,"work_id":"c61c2301-5e65-4715-ac09-dcc479c633ad","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:9cd3dca5c5bdd8aee7d438df72c2e620a960eaebbb61080aaccf3cb8e19bd625","observation_id":"5517b29e-903c-4223-89a1-f84079b4f418","resolution":{"observed_at":"2026-07-08T13:04:56.696136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:56.743354Z","title":"Tree search for llm agent reinforcement learning","venue":null,"work_id":"69c0b47c-2fb7-417a-8ff3-444cc4a56703","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:c54cdee9fb9d1ce0d55c2125b4ee0f8722340a51c66a958494727dad1c328e78","observation_id":"957ff1d1-e873-46b1-b8d2-06258fc57d2f","resolution":{"observed_at":"2026-07-08T13:04:56.744901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14545","doi":"10.48550/arxiv.2510.14545","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic entropy-balanced policy optimization","venue":"arXiv (Cornell University)","work_id":"da44e859-fbd4-479a-9523-0b6f798ebc23","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:09f987fd1f29d88ad096d7b9c22ba7863c76012a0432827b22caadc05f572e99","observation_id":"f41b96ba-06e1-48cb-af03-3eb52abc5429","resolution":{"observed_at":"2026-07-08T13:04:56.704280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:b5f7ee946a7cf056911f8c9d39b1c4c30fa9a2f82461057769f281d2335fdadc","observation_id":"746a0598-b11f-487d-9302-53595c7fd4f5","resolution":{"observed_at":"2026-07-08T13:04:56.709206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.086056Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"f42c8e62-7c0d-4824-b1a2-906653781f5c","year":2024},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:9a8dcd135b647f458fe294bb5c3fbfe035990c094c75d2d194c419e734441a86","observation_id":"533705bc-d6b6-4971-afa2-0eb313595668","resolution":{"observed_at":"2026-07-08T13:04:57.087498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:b23e2ecf045df4230b402ea7ca5ac982a8bf9587896fce4ce51c21ea802f8b8f","observation_id":"1ace522c-3a58-4e76-a26b-5012f4e794d6","resolution":{"observed_at":"2026-07-08T13:04:56.735738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:3dc4a0bef8d0602ef2cd9d5cdf0a2018c35af3b9286bdf4438dac0784f2d823f","observation_id":"c40d23b7-eece-4928-99e9-19d3e0d190cf","resolution":{"observed_at":"2026-07-08T13:04:56.706723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":"2505.04588","doi":"10.48550/arxiv.2505.04588","metadata_source":"pith","pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","venue":"cs.CL","work_id":"0ea11521-4603-4e7a-abe3-bbc2f3e3f71c","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:0c9f81f951d4598ca5efe129272a9d2d331dc4839e277a5900d4ef6a566d1200","observation_id":"76a4e2d2-bb8f-4746-9e5b-1a996670f524","resolution":{"observed_at":"2026-07-08T13:04:56.726732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.05592","doi":"10.48550/arxiv.2503.05592","metadata_source":"pith","pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","venue":"cs.AI","work_id":"f5ed73d2-f2ff-4cf6-853d-3586333e44ef","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:cbeeca6b394e3e8ad9b5d988efbe42671666e5123a8daf4ce8dd0c93962e5f94","observation_id":"fbd51867-5c1e-427a-970d-6080a2d3ed18","resolution":{"observed_at":"2026-07-08T13:04:56.732119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.072620Z","title":"Smart-searcher: Incentivizing the dynamic knowledge acquisition of llms via reinforcement learning","venue":null,"work_id":"c5de9ca1-7e7e-43df-93d9-40ecc9ab7755","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:1fff31cf3b4b404c2c636bdabc45c1db5af257eb24c4092134953547f2244b6b","observation_id":"40f437aa-3049-4bf9-8921-3c39e18ee3c7","resolution":{"observed_at":"2026-07-08T13:04:57.073965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-08-13T16:35:29.551646Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:76eb1da74252d0d6b77f4956aa83b01817f7d226076e5f7e2f9bcefec5b67e62","observation_id":"733fe686-4d61-4648-8494-88de7018c776","resolution":{"observed_at":"2026-07-08T13:04:56.729725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-08-14T09:16:00.399049Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.19849","doi":"10.48550/arxiv.2507.19849","metadata_source":"pith","pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Reinforced Policy Optimization","venue":"cs.LG","work_id":"6cb0d241-5e4d-44ed-9476-659819ec0681","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:e03b7bdd01588b12ddf79166868f51f24aa0cf5280c8691be11724039ab22312","observation_id":"9641d324-553f-4063-8ade-d0947055e109","resolution":{"observed_at":"2026-07-08T13:04:56.693393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:16:21.116017Z","title":"Natural questions: a benchmark for question answering research.Transactions of the Association for Computational Linguistics, 7:453–466","venue":null,"work_id":"36c00860-e248-432b-864c-9ff0740d4ac0","year":2019},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:8383df39f6131a7b4cf8182850252d2b8c01e1c9099f8988f973ee7848987569","observation_id":"b46cd4e0-7718-4392-829a-35b24d6e2297","resolution":{"observed_at":"2026-07-08T13:04:57.089868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.074726Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":"8b4499bc-7412-4fd2-83d6-28182ece7f00","year":2017},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:30008b7aca662945e3d3a376029a45b81251b5d38873ea8e048171e6eb8a138e","observation_id":"7a7ae40f-1efd-4503-abf7-7c5332196998","resolution":{"observed_at":"2026-07-08T13:04:57.076213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:36:22.357163Z","title":"When not to trust language models: Investigating effectiveness of parametric and non-parametric memories","venue":null,"work_id":"c7c8ca77-f0f4-41c3-b800-889503dd497f","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:5bb0ed8b94d2b582c9ecd63f8cd01b8c07f4611ea3fac26f1aa6907b3e96a190","observation_id":"71e13e9f-c272-4e1e-a83f-32eee4a60b52","resolution":{"observed_at":"2026-07-08T13:04:57.081101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.070545Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":"9fa645a0-3bf0-4986-aba9-dff1f0dfb78b","year":2018},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:50353c654f9a1268bf4e1c9b341bbd9d5b2e6c44480dbba6c0eb710b874b44b2","observation_id":"588a4f76-4c1f-496c-8435-803fdfe81971","resolution":{"observed_at":"2026-07-08T13:04:57.072005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.068389Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":"fd2bf568-cbd2-407a-a17c-0d9f01efdd9c","year":2020},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:db2337633df4002c119b3b05c60e63321889a3859977c38895a7d36051e50539","observation_id":"ca273a76-9e6c-4df2-abef-9dd2c4417ae1","resolution":{"observed_at":"2026-07-08T13:04:57.069900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:16:21.060214Z","title":"Musique: Multihop questions via single-hop question composition.Transactions of the Association for Computational Linguistics, 10:539–554","venue":null,"work_id":"c8d66a44-9695-4211-998e-a85a97efa16e","year":2022},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:665ee65cc0bc21b94ee95e533d2c23b861f943c3c9928e35611627182f5c425e","observation_id":"d7a05ff2-e2b9-45ef-bf4f-34290dfa4c1b","resolution":{"observed_at":"2026-07-08T13:04:57.063647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.064523Z","title":"Measuring and narrowing the compositionality gap in language models","venue":null,"work_id":"997bfd0b-443c-4ff9-8c1a-1ae7bb3b6962","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:777a1032ffd62cadf824758011d1c71b9a0fd435755fe67b0bdd5aa91653727a","observation_id":"95cbde69-9b32-4dbe-af78-721da3d53d77","resolution":{"observed_at":"2026-07-08T13:04:57.066034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.066611Z","title":null,"venue":null,"work_id":"5367b59e-43c6-4ca3-84fa-fcc5e6a40037","year":2024},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:73acf0819563b20a9631ed3c761858b2b37a77a27a0ab3bd7e1bde6f6a590704","observation_id":"e92f7f51-20c9-40bc-81e6-3d8406a88775","resolution":{"observed_at":"2026-07-08T13:04:57.067705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":"2212.03533","doi":"10.48550/arxiv.2212.03533","metadata_source":"pith","pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","venue":"cs.CL","work_id":"789cc674-467e-4f23-bb50-05c79fe8c4c2","year":2022},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:b28c7b18b1c668626143859af138faf885ca442963d858cfa7ef47f40d371b25","observation_id":"76e253ca-14b7-44a0-ab5e-51ed8aa1c835","resolution":{"observed_at":"2026-07-08T13:04:56.699304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.076950Z","title":"Asymptotic evaluation of certain markov process expectations for large time, i.Communications on pure and applied mathematics, 28 (1):1–47, 1975","venue":null,"work_id":"8182af5a-bc26-442c-bdce-640b0a806100","year":1975},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:74aa94cb2ba70b1d40e7e29af38cbdad3d14f0acf6e6123f0038e3d9f11f56e0","observation_id":"7b48ea87-c656-4864-8393-c46097a58a1b","resolution":{"observed_at":"2026-07-08T13:04:57.079064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":16},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2607.06223."}