{"as_of":"2026-08-06T19:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8bd8a176109c93faabbf9d17d72d7183d5f6ef9c6dd6708b49a78d95b115ffc7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:20:40.072107Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T13:04:56.727934Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T09:15:08.193357Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2505.10978"},"observation_digest":"sha256:3a5ef3d0bcc095099ed7b9173974f343e166c7fe9f85f21dbdad03f7701c6084","observation_id":"5f9244b7-87c3-4e89-b3db-e8c95144cc37","resolution":{"observed_at":"2026-05-11T09:15:08.622111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-05T21:12:12.451731Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09303","last_updated":"2025-08-12T19:38:21Z","snapshot_observed_at":"2026-08-05T21:12:09.160784Z","submitted_at":"2025-08-12T19:38:21Z","title":"ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T21:12:12.451731Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2508.09303"},"observation_digest":"sha256:44381358f26acafb6aad9e34a1131f7d4fbf4c0c2642afc9015bf4e8a90e8730","observation_id":"82c3f128-cd6b-4ca1-b174-dfc382795218","resolution":{"observed_at":"2026-08-05T21:12:12.451731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-05T23:57:35.446112Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13167","last_updated":"2025-08-06T17:01:02Z","snapshot_observed_at":"2026-08-05T23:57:29.481263Z","submitted_at":"2025-08-06T17:01:02Z","title":"Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T23:57:35.446112Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2508.13167"},"observation_digest":"sha256:0624a70bfe5e3aecce4043639d6ae5d208d72a1c3acf6b23038ecea17f46566d","observation_id":"47a1e444-233c-42af-bd0b-a92e31b51857","resolution":{"observed_at":"2026-08-05T23:57:35.446112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":280,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:d54cf2f9f48995f74807a2c574937a0f0dd5d0a77ab38acb4474358c982eb8f1","observation_id":"5e1666c2-d673-4616-a540-ed43729ee018","resolution":{"observed_at":"2026-05-18T19:21:48.572696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2510.00861","last_updated":"2026-04-20T08:17:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T13:10:36Z","title":"Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T11:06:20.058342Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2510.00861"},"observation_digest":"sha256:5970e746d7f80b0ab99a28798287bd4cf2cae766b4ba00e8c530376f0816e624","observation_id":"8e9fd6de-99b2-4e1f-b9e1-580c3c687b17","resolution":{"observed_at":"2026-05-18T11:11:18.260446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-04T09:50:50.408334Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13272","last_updated":"2026-06-03T06:16:13Z","snapshot_observed_at":"2026-08-04T09:50:40.294347Z","submitted_at":"2025-10-15T08:17:52Z","title":"Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T09:50:50.408334Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2510.13272"},"observation_digest":"sha256:3617c10453f1cb4bef7751b2d125ba926a4068392dbe5c512fabcebdbe6c31b5","observation_id":"bdd4d1db-c793-41da-ab9e-65725839cfbe","resolution":{"observed_at":"2026-08-04T09:50:50.408334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-03T23:33:50.356852Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05385","last_updated":"2026-07-23T06:36:18Z","snapshot_observed_at":"2026-08-04T04:34:49.292424Z","submitted_at":"2025-11-07T16:08:34Z","title":"TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:50.356852Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2511.05385"},"observation_digest":"sha256:d250ebd747d7152719c04dea585cde7e9d627ab5ae33ee8e50d9822eb19234b4","observation_id":"77e100f0-2904-4f0b-aea0-c0055fab618a","resolution":{"observed_at":"2026-08-03T23:33:50.356852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-02T20:25:01.404692Z","title":"mislabeled","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.23440","last_updated":"2026-07-09T12:47:01Z","snapshot_observed_at":"2026-08-04T10:17:58.534193Z","submitted_at":"2026-02-26T19:05:40Z","title":"Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T20:25:01.404692Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2602.23440"},"observation_digest":"sha256:cc346000b71f5604f671485964e136969124e006bd8a88bbb6a2693335e56ecc","observation_id":"dda22789-8f60-40e1-b75b-0e9db858154c","resolution":{"observed_at":"2026-08-02T20:25:01.404692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2604.09455","last_updated":"2026-04-10T16:14:48Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:14:48Z","title":"E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T18:08:18.056525Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2604.09455"},"observation_digest":"sha256:379501140fbaaf0843c936482055bbfe85cbcb08d98d30f26ee359302cc07da1","observation_id":"d89acafe-afeb-498e-9828-b297d9155d1f","resolution":{"observed_at":"2026-05-11T05:25:59.776769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2604.14054","last_updated":"2026-05-25T13:50:41Z","snapshot_observed_at":"2026-08-02T01:13:47.904200Z","submitted_at":"2026-04-15T16:34:39Z","title":"$\\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T13:43:09.581054Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2604.14054"},"observation_digest":"sha256:22fee17ff9fe8b3975ba2b580c6a3d4b2c5bda33670e979eea24fd034fefb63a","observation_id":"90f0cf76-e5e0-4776-9f45-f82b1adae920","resolution":{"observed_at":"2026-05-10T13:45:27.840116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2605.09287","last_updated":"2026-05-12T03:05:01Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T03:21:47Z","title":"PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:21.469086Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2605.09287"},"observation_digest":"sha256:25d66e14b2bd7ef3b85631d890a00245904c76284f35e84d0b033a27a4db3d83","observation_id":"a715c2fd-ff47-4ab7-94d8-a02b8f4ac245","resolution":{"observed_at":"2026-05-12T06:06:26.662716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2605.09287","last_updated":"2026-05-12T03:05:01Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T03:21:47Z","title":"PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T07:34:32.166480Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2605.09287"},"observation_digest":"sha256:b0a8f4bd3c3b2676968f8b743bfef8a5f9dc3199e338b8d990a9335d841b8be0","observation_id":"62eb5c5d-e137-4c90-b007-1781216907f4","resolution":{"observed_at":"2026-05-13T07:37:29.679737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2605.17734","last_updated":"2026-05-18T01:35:11Z","snapshot_observed_at":"2026-07-06T23:28:41.111402Z","submitted_at":"2026-05-18T01:35:11Z","title":"Harnessing LLM Agents with Skill Programs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T11:26:19.382463Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2605.17734"},"observation_digest":"sha256:02330cdf9db37d30505074162dbd3b908f4bad64a1f392b69c710a85b3b8ed3f","observation_id":"89303f49-90db-40e4-9daf-e8468738297e","resolution":{"observed_at":"2026-05-20T11:28:14.387703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2605.18299","last_updated":"2026-05-18T12:18:47Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T12:18:47Z","title":"SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T09:59:17.346548Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2605.18299"},"observation_digest":"sha256:ae4d8018ce74117040d643af36e217d012167bc5d7d007abb085848c1cc5dce8","observation_id":"5554b0c3-3278-4092-a2dc-63a5476a0f77","resolution":{"observed_at":"2026-05-20T10:03:14.662474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2605.22511","last_updated":"2026-05-26T13:56:53Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T14:00:57Z","title":"Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T06:08:22.252524Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2605.22511"},"observation_digest":"sha256:0d9f3f877e3c8a52f1b2834b1f9135137e600810ad72d785d7e8eac3b32e444f","observation_id":"04b16e29-d8c8-413a-88da-6f308ad9e551","resolution":{"observed_at":"2026-05-22T06:11:09.155728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2605.22511","last_updated":"2026-05-26T13:56:53Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T14:00:57Z","title":"Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T17:24:26.923687Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2605.22511"},"observation_digest":"sha256:c8fdbc7d9326dd917559bbbc4b8fb8147581e9b2c23c014173f257d457efc225","observation_id":"f5a9e757-4c28-4535-bde2-fbadbae3ab0f","resolution":{"observed_at":"2026-06-30T17:24:56.743506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:5b6e0da02e2c36fd217c80b8792d0cf18954590944ad0f24088ecd2a6595cce4","observation_id":"67705cae-0a56-41ee-9152-ac4e29548a0d","resolution":{"observed_at":"2026-07-01T20:56:13.462913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2606.02373","last_updated":"2026-06-01T15:21:41Z","snapshot_observed_at":"2026-08-02T17:23:05.614302Z","submitted_at":"2026-06-01T15:21:41Z","title":"Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-06-28T14:25:08.052988Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.02373"},"observation_digest":"sha256:338da1288d2ba7a1cacac4c769be8245c10ffba6cce503cba41ccfe2599cbef1","observation_id":"80832a9b-e435-4a00-afdf-f06b668aa714","resolution":{"observed_at":"2026-07-01T23:26:22.099072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2606.05885","last_updated":"2026-06-04T08:54:09Z","snapshot_observed_at":"2026-08-01T19:07:49.288895Z","submitted_at":"2026-06-04T08:54:09Z","title":"When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T02:17:32.324432Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.05885"},"observation_digest":"sha256:b4a9e62b06d4828b88e3bd7511741c03cb552f039159b56a50e629a05c56c9ad","observation_id":"ae6b84d7-f4b5-4510-9421-cecfa4c3c4cb","resolution":{"observed_at":"2026-07-02T12:16:56.871475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2606.08755","last_updated":"2026-06-07T17:55:55Z","snapshot_observed_at":"2026-08-01T04:11:26.349236Z","submitted_at":"2026-06-07T17:55:55Z","title":"Co-Evolving Skill Generation and Policy Optimization","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T18:37:00.015083Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.08755"},"observation_digest":"sha256:61c4d76bed11246736400091fd3f7fa56bae605ea50c17358acb66ae4d1826eb","observation_id":"ffaea00e-6581-4880-a5f1-68dd30ab359c","resolution":{"observed_at":"2026-07-02T22:57:25.881525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-03T22:58:07.832067Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T17:22:16.055502Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:155a5d610be2f6dd5044e095eb6394765357170f84802dbe0c9a4d2d31338cf5","observation_id":"538e4a03-48c6-4322-8bc7-350f39348636","resolution":{"observed_at":"2026-07-03T00:17:28.917625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-12T14:37:28.660097Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-03T22:58:07.832067Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T14:37:28.660097Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.09348"},"observation_digest":"sha256:aee4123ffe9ce6a842b0353b3fd2dba5afa00f1cda0ccbb4ba72d7850fa4c29f","observation_id":"d52464a9-a930-4b0c-8ca9-24415466a351","resolution":{"observed_at":"2026-07-12T14:37:28.660097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-05T23:10:47.877661Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T06:39:34.199607Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:c9dae966d5ed714403fcd9cfd30a85d46e92ea81fb2d3273e20a95aa78172c61","observation_id":"91115b55-54b5-4efc-b863-5981c9d9aaba","resolution":{"observed_at":"2026-07-03T15:08:33.357678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-03T02:12:23.414741Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-05T23:10:47.877661Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:23.414741Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:21ec6fcccc38f3f74f7d4984248e93bad32ddc926bd111a7071dd83a12d03ac7","observation_id":"a1b21114-9d2a-4b4f-aed3-ec6ed1c30fda","resolution":{"observed_at":"2026-08-03T02:12:23.414741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2606.22995","last_updated":"2026-06-22T08:12:47Z","snapshot_observed_at":"2026-07-06T23:57:47.047975Z","submitted_at":"2026-06-22T08:12:47Z","title":"Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T08:44:23.085858Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2606.22995"},"observation_digest":"sha256:54b106bb68a090baf737f483453e484afb59f0ebdf2af56b1ff77fb49c9fffbc","observation_id":"2409857c-a3f5-4f08-aab0-b5a6b817a4cd","resolution":{"observed_at":"2026-07-04T10:29:45.757145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-07-10T23:18:22.383935Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:15482972cf05154df880a4502a853a000400527c2742257c7ffed49f10043aff","observation_id":"733fe686-4d61-4648-8494-88de7018c776","resolution":{"observed_at":"2026-07-08T13:04:56.729725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-01T23:46:17.626014Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15257","last_updated":"2026-07-16T17:51:23Z","snapshot_observed_at":"2026-08-06T13:05:38.919490Z","submitted_at":"2026-07-16T17:51:23Z","title":"SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T23:46:17.626014Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2607.15257"},"observation_digest":"sha256:25511864ec7b29e2a462b9e2a07b448126e527dfdcf1f66cd884481cd5423d45","observation_id":"10c737c3-645d-49ab-9e8a-d5b20ac9ffb9","resolution":{"observed_at":"2026-08-01T23:46:17.626014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-06T00:20:40.072107Z","title":"arXiv:2505.15107","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01359","last_updated":"2026-08-02T16:22:27Z","snapshot_observed_at":"2026-08-06T19:22:18.469221Z","submitted_at":"2026-08-02T16:22:27Z","title":"EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:20:40.072107Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2608.01359"},"observation_digest":"sha256:ec0866df6668949e0b4e7f77032c1031c3a5d3d0c4ad2d7b7f3a61d2f4334aed","observation_id":"ab23ebee-b632-4e80-ae75-1775ba2bac1d","resolution":{"observed_at":"2026-08-06T00:20:40.072107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-08-04T15:12:55.832980Z","title":"2025 , archivePrefix =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-06T19:29:56.813706Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.832980Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:f210dc260442b7f60fef525f02cafacfc785c9dda409dbc7f29b1403e308f33b","observation_id":"16c9d078-39ed-4e86-877e-921490f8de89","resolution":{"observed_at":"2026-08-04T15:12:55.832980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15107/citation-record","integrity":"/paper/2505.15107/integrity","json":"/paper/2505.15107/citation-record.json","paper":"/paper/2505.15107"},"outbound":[],"paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T21:27:32.828750Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2505.15107."}