{"as_of":"2026-08-08T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:388461ab828560dfbbbf580cd86278220b55ddcb9e5c300e56c75b1c09d50db9","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:06:08.486342Z","state":"measured"},{"denominator":120,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":120,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:26:56.575865Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-06T23:26:56.575865Z","title":"Tool-star: Empowering llm-brained multi-tool reasoner via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-06T23:20:46.744749Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:56.575865Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2506.18096"},"observation_digest":"sha256:407b321c32e2dc05c6dda9a9c7b2e34acb8b70461abe68c3be2e8df375b77e15","observation_id":"26238ddb-55ef-4b2a-9f10-2735e6547f87","resolution":{"observed_at":"2026-08-06T23:26:56.575865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-06T22:31:36.509403Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21384","last_updated":"2025-06-26T15:35:12Z","snapshot_observed_at":"2026-08-07T20:42:59.691167Z","submitted_at":"2025-06-26T15:35:12Z","title":"Leveraging LLM-Assisted Query Understanding for Live Retrieval-Augmented Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:31:36.509403Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2506.21384"},"observation_digest":"sha256:71cf64724d09f81fd7d6ddf200da1a5b4f8194317a51b8755a79b94e5fa5d4a8","observation_id":"57099b37-beae-4b05-a5c4-9e9ca5be68b5","resolution":{"observed_at":"2026-08-06T22:31:36.509403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2507.13334","last_updated":"2025-07-21T17:48:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T17:50:36Z","title":"A Survey of Context Engineering for Large Language Models","version":2},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-05-13T20:58:45.060041Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2507.13334"},"observation_digest":"sha256:c6667d93aa47f842ed7e43ee0df8598049a05cbd581f4f730cf6db1a559a1547","observation_id":"8249ae1b-0f50-430e-a455-2913c4bae6bd","resolution":{"observed_at":"2026-05-13T20:58:45.317119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-06T12:23:55.066336Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21836","last_updated":"2025-07-29T14:12:28Z","snapshot_observed_at":"2026-08-07T20:39:44.012130Z","submitted_at":"2025-07-29T14:12:28Z","title":"AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T12:23:55.066336Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2507.21836"},"observation_digest":"sha256:c0cd0a80a5a1efae97322ef69408e90de86cea1004026c8f047a1c745c4af904","observation_id":"61e64d85-0ef9-4e7b-8d37-94c49eb4807c","resolution":{"observed_at":"2026-08-06T12:23:55.066336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-06T10:17:13.551033Z","title":"Tool-star: Empowering llm-brained multi-tool reasoner via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00271","last_updated":"2025-09-01T02:48:41Z","snapshot_observed_at":"2026-08-07T10:28:46.635998Z","submitted_at":"2025-08-01T02:30:32Z","title":"MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T10:17:13.551033Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2508.00271"},"observation_digest":"sha256:8dd4e33fbb5a8b6ca87f346c0190d3a00f2f894df6af02a2471eb39bb565fd5c","observation_id":"1ec53e26-e08c-4eaa-b6f8-4349080788a5","resolution":{"observed_at":"2026-08-06T10:17:13.551033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2508.07407","last_updated":"2025-08-31T14:55:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-10T16:07:32Z","title":"A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T23:21:42.029285Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2508.07407"},"observation_digest":"sha256:99be3a41b683b011b3f4a9d109ff2c1e51e1838454a3dfe34f87bd3dfa8877ae","observation_id":"5c8e51c0-4b72-44f0-baa2-9ff8928beed1","resolution":{"observed_at":"2026-05-15T23:21:42.329827Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T23:57:31.860107Z","title":"Tool-star: Empowering llm-brained multi-tool reasoner via reinforcement learning.arXiv preprint arXiv:2505.16410, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13167","last_updated":"2025-08-06T17:01:02Z","snapshot_observed_at":"2026-08-05T23:57:29.481263Z","submitted_at":"2025-08-06T17:01:02Z","title":"Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:57:31.860107Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2508.13167"},"observation_digest":"sha256:06a3a9f41ce9ed016afa9391fb662549e5236e0957f65b43de725d9877ff5a09","observation_id":"6d12bb68-7528-4280-9e78-e7c7d7d238ba","resolution":{"observed_at":"2026-08-05T23:57:31.860107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:e87d5d5d2204e8dcad913a55657a6e0b24a37bb27f72a1ef8704cbd56c057572","observation_id":"8c997f8d-da85-4462-888f-99a8a655b5c8","resolution":{"observed_at":"2026-05-18T00:02:25.278117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-04T17:57:52.334039Z","title":"Tool-star: Empowering llm-brained multi-tool reasoner via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.14257","last_updated":"2026-07-23T12:32:53Z","snapshot_observed_at":"2026-08-05T11:19:48.609021Z","submitted_at":"2025-09-12T15:34:07Z","title":"Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:52.334039Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2509.14257"},"observation_digest":"sha256:85d99174a1ece12bca09c21d3ada6be015b3ed182d21a0694f8b0b1d75802831","observation_id":"4cf73df6-8d84-4a8c-9504-70b53a7eb141","resolution":{"observed_at":"2026-08-04T17:57:52.334039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-04T16:07:28.753936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.753936Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:f4eef3a45a2eab47c3c69fa7785f812157c615c6a61a8f47b0197eb5e07dc92b","observation_id":"c39a617e-8a38-456c-a1b9-3b25bf595665","resolution":{"observed_at":"2026-08-04T16:07:28.753936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-04T14:49:51.555062Z","title":"Tool-star: Empowering llm-brained multi-tool reasoner via reinforcement learning.arXiv preprint arXiv:2505.16410, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23292","last_updated":"2026-06-29T12:46:01Z","snapshot_observed_at":"2026-08-07T20:42:40.147533Z","submitted_at":"2025-09-27T13:10:37Z","title":"Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T14:49:51.555062Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2509.23292"},"observation_digest":"sha256:ba47cbb5d3b8a7d421a4e1d26ebb2e5c739fbcfe6717b4658e41ab2fa1f35ab8","observation_id":"d53bfd2c-ef7d-496d-9924-bbd31e9e9dc6","resolution":{"observed_at":"2026-08-04T14:49:51.555062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-03T18:03:36.415695Z","title":"Tool-star: Empow- ering llm-brained multi-tool reasoner via reinforcement learning.arXiv preprint arXiv:2505.16410,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.07287","last_updated":"2026-06-28T11:58:42Z","snapshot_observed_at":"2026-08-05T13:20:26.960914Z","submitted_at":"2025-12-08T08:27:24Z","title":"Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:03:36.415695Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2512.07287"},"observation_digest":"sha256:203534fef91fff8153693fa4ac53de62034b0ff8f97737e69889ef5049f8654f","observation_id":"72f33c36-2fab-44a6-93a7-49a1d4ea5b14","resolution":{"observed_at":"2026-08-03T18:03:36.415695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-03T05:56:57.071345Z","title":"Tool-star: Empowering llm-brained multi-tool reasoner via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.00994","last_updated":"2026-05-28T05:45:59Z","snapshot_observed_at":"2026-08-03T20:08:32.559639Z","submitted_at":"2026-02-01T03:19:22Z","title":"Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T05:56:57.071345Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2602.00994"},"observation_digest":"sha256:f50ac201479ba93d8fd5d2a26082d0607c2aaa725ce4ee6b8ec2b8d3a03732e4","observation_id":"cca8698f-4717-4727-b186-7865c2f30559","resolution":{"observed_at":"2026-08-03T05:56:57.071345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2603.16876","last_updated":"2026-05-08T08:14:14Z","snapshot_observed_at":"2026-08-02T05:44:39.173956Z","submitted_at":"2026-02-17T12:48:32Z","title":"Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T21:51:10.972744Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2603.16876"},"observation_digest":"sha256:8b7dbc67da8d6f53465c54ef7f504bb3f45bd937b9bc4207fe0a9d58e8f4761a","observation_id":"2eee2387-aef1-4049-93d4-754602ccb4fc","resolution":{"observed_at":"2026-05-15T21:51:40.747261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2603.23964","last_updated":"2026-04-13T08:15:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-25T05:56:54Z","title":"From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments","version":2},"reference_index":201,"source":"pdf_text","source_observed_at":"2026-05-15T01:20:03.181903Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2603.23964"},"observation_digest":"sha256:6aeee45aa4307aee523f8b2b9a6cea1e0d4549df16a437975904cc56df2dfee9","observation_id":"782c5788-7aec-4c3c-ac47-15f9e354c63a","resolution":{"observed_at":"2026-05-15T01:23:27.288717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2604.05387","last_updated":"2026-04-07T03:35:06Z","snapshot_observed_at":"2026-08-03T02:43:14.338332Z","submitted_at":"2026-04-07T03:35:06Z","title":"Data-Driven Function Calling Improvements in Large Language Model for Online Financial QA","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T19:25:26.811390Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2604.05387"},"observation_digest":"sha256:468e8908e309607e2555d14d1002eaabaa7436492cbbc40e87488ebe02ab380e","observation_id":"084cdba8-6810-472e-b25e-6bcfd79a999d","resolution":{"observed_at":"2026-05-10T23:00:49.508970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2604.09455","last_updated":"2026-04-10T16:14:48Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:14:48Z","title":"E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T18:08:18.056525Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2604.09455"},"observation_digest":"sha256:5ce4765ffd5e8b92d1df5d08773236c7a9267535f964988e319a1cc1b664ced9","observation_id":"31bd0abe-80a2-4ab8-9381-690740a6df9a","resolution":{"observed_at":"2026-05-11T05:25:59.937831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:7ba3d0ef9057a3d7d7d839daeedb8748a5238a5065e0a4e8b46b2b981c501136","observation_id":"3bee09b4-f1f4-4348-9163-07973725b8ee","resolution":{"observed_at":"2026-05-11T06:15:58.424047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:00.503836Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2604.18292"},"observation_digest":"sha256:1e28534e28fa1058f27e875f194744abb602f3a39dd14a0eccfb8f4c02511f68","observation_id":"e9ac6733-1ad4-4aa6-b9d9-15bdb1d04c7b","resolution":{"observed_at":"2026-05-10T05:25:54.223482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2605.07237","last_updated":"2026-05-11T02:57:28Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T04:42:05Z","title":"Teaching Language Models to Think in Code","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T02:33:02.995360Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2605.07237"},"observation_digest":"sha256:48113bb3907a7a4ddbc36d1559b016a3e21314dcb5a1e992ac0ea44d18a78a27","observation_id":"407fad62-21f3-4e68-b6b4-9bf344089a81","resolution":{"observed_at":"2026-05-11T03:15:56.498224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2605.07237","last_updated":"2026-05-11T02:57:28Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T04:42:05Z","title":"Teaching Language Models to Think in Code","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:26:11.265781Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2605.07237"},"observation_digest":"sha256:baf5cb983364d14d2e87ced53e277f337f0672217a01a15717635fc386199b44","observation_id":"c63639f7-9229-49a5-8728-2f23fb64545b","resolution":{"observed_at":"2026-05-12T06:16:28.390643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2605.09544","last_updated":"2026-05-10T13:56:46Z","snapshot_observed_at":"2026-07-31T07:40:23.585067Z","submitted_at":"2026-05-10T13:56:46Z","title":"TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T02:47:31.830410Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2605.09544"},"observation_digest":"sha256:220eab9fc3fbeeb8b7aa8c3811027f9a2c82f8524bc5132b6e0f1b227d216065","observation_id":"bab25d3d-c1ec-460f-8e49-fc9827819e64","resolution":{"observed_at":"2026-05-12T07:31:23.986138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2605.09931","last_updated":"2026-05-11T03:28:43Z","snapshot_observed_at":"2026-08-03T02:44:35.388736Z","submitted_at":"2026-05-11T03:28:43Z","title":"PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:49.165066Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2605.09931"},"observation_digest":"sha256:55b501881292d1da50248a6ad7ca108b22d1483cdbc020423a91e65ac123a092","observation_id":"2154c720-8d36-4496-9cab-3c05b7e3268e","resolution":{"observed_at":"2026-05-12T06:01:23.278748Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-08-07T08:55:02.984200Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:864a0276c77e15e4a61b3e4723993979c4304c0da04902c7b7588cf632f5c574","observation_id":"751d4fcb-e620-4ec5-abcc-dc6947058c96","resolution":{"observed_at":"2026-05-13T05:07:17.727198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2605.12481","last_updated":"2026-05-12T17:57:04Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:57:04Z","title":"ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T03:51:54.401200Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2605.12481"},"observation_digest":"sha256:02f19b375e25ffcd3e41e735898638a557ade6247952072b8c670223d15465f7","observation_id":"0a0d90ec-834b-4ada-b8af-32f410603583","resolution":{"observed_at":"2026-05-13T03:52:12.303055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2605.20743","last_updated":"2026-05-20T05:46:14Z","snapshot_observed_at":"2026-08-02T18:43:14.534256Z","submitted_at":"2026-05-20T05:46:14Z","title":"Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T06:05:45.046156Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2605.20743"},"observation_digest":"sha256:9f8633225b7cd86b7d670da2337ba460dd1cbfc9df892e67d0199043a3054ce1","observation_id":"707e0454-297d-4895-a8f1-af98616163da","resolution":{"observed_at":"2026-05-21T06:09:41.517513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:50dddd6e0174a3d47d91108249b1972caacf7a85766276dbffc6ddfaa14cb541","observation_id":"898960cb-a66d-4f3e-8cb9-5dd058afa2b4","resolution":{"observed_at":"2026-07-01T20:56:13.553725Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2606.02132","last_updated":"2026-06-02T07:53:40Z","snapshot_observed_at":"2026-08-03T12:22:05.499867Z","submitted_at":"2026-06-01T11:58:55Z","title":"Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T14:59:57.983338Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2606.02132"},"observation_digest":"sha256:4b593b81bde678bda4d87dc9ddf312663482699fe9ff1b479a91b4f79eb61df1","observation_id":"639eeddd-856a-470d-8cbe-1fd351a1493e","resolution":{"observed_at":"2026-06-28T15:02:18.700268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2606.02518","last_updated":"2026-06-01T17:27:48Z","snapshot_observed_at":"2026-08-01T13:26:48.045604Z","submitted_at":"2026-06-01T17:27:48Z","title":"ToolFG: Towards Well-Grounded Fine-Grained Image Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:06.186594Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2606.02518"},"observation_digest":"sha256:339085d0c95fb6cd3ea5b853018b5478c6c097426dff39eefa8d89dfaa72f187","observation_id":"80e8188d-8c77-4e2a-b6bc-3d98bda5218c","resolution":{"observed_at":"2026-07-01T22:56:20.338611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2606.03762","last_updated":"2026-06-02T15:16:12Z","snapshot_observed_at":"2026-08-02T17:38:14.832178Z","submitted_at":"2026-06-02T15:16:12Z","title":"Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T11:19:31.702516Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2606.03762"},"observation_digest":"sha256:39167bc4c3ecc51627c97e62b0c31dd836e3b4f969c692fe7008c1ab59131727","observation_id":"27969eb6-8c88-47cd-8b7e-643059f52c85","resolution":{"observed_at":"2026-07-02T02:06:26.289106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2606.05885","last_updated":"2026-06-04T08:54:09Z","snapshot_observed_at":"2026-08-08T00:56:45.958148Z","submitted_at":"2026-06-04T08:54:09Z","title":"When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T02:17:32.324432Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2606.05885"},"observation_digest":"sha256:42eaa757abdc3af06908cbbbb60fad9053790797d6f47ee7008cfa1456099327","observation_id":"5d04b888-c649-42c2-b7ca-ae6f7837d636","resolution":{"observed_at":"2026-07-02T12:16:56.884050Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T10:21:55.485624Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:9861932bf555e84667cb84273b60c900f4538acbf58f362fb364707e01fe9117","observation_id":"0e47b6b6-929a-44e0-b716-146985896a3f","resolution":{"observed_at":"2026-07-03T09:37:49.295388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-03T02:12:26.150859Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:26.150859Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:dc1893f954ed60eb896c9f4eb0b653d7dd4132e5c00d37ff5ef873e0ae682ef3","observation_id":"44a3994b-2af1-4c3e-9f49-65b04b8794c1","resolution":{"observed_at":"2026-08-03T02:12:26.150859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-02T03:10:51.509228Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-07T15:22:35.060941Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.509228Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:50a807f3f1f859b3617381b9027edfbe6da6b409e14c2bdbd9d09b6a5c14baaa","observation_id":"a6de5c47-ed61-469e-a188-460913426f03","resolution":{"observed_at":"2026-08-02T03:10:51.509228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-02T11:06:38.022901Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20498","last_updated":"2026-06-16T07:59:46Z","snapshot_observed_at":"2026-08-07T14:16:22.260206Z","submitted_at":"2026-06-16T07:59:46Z","title":"AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T11:06:38.022901Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2607.20498"},"observation_digest":"sha256:e7fe08874288bc4c9ae82ed974e3f2942827a8ee69584a225016b1dd81beec43","observation_id":"e01b077e-76b7-4348-b052-0bcf74aafbde","resolution":{"observed_at":"2026-08-02T11:06:38.022901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-07-31T20:06:10.315097Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-03T00:02:04.534763Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:10.315097Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:c4a06505d08c034452caf1342ba4de2acf442433e81ca1e4787894b0786410c0","observation_id":"032d3af7-9043-4df6-94e3-156e805cafde","resolution":{"observed_at":"2026-07-31T20:06:10.315097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-07-31T20:06:18.144305Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28026","last_updated":"2026-07-30T11:14:11Z","snapshot_observed_at":"2026-08-03T00:02:04.534763Z","submitted_at":"2026-07-30T11:14:11Z","title":"Contrastive Reinforced Policy Optimization via Privileged Self-Distillation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-31T20:06:18.144305Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2607.28026"},"observation_digest":"sha256:b7ea50fd5be1b6daa9c0a91753509407372b5c2ce25b96e0db41bc05d98e4354","observation_id":"b6ccbbc4-bf13-4618-b828-bd37700535d2","resolution":{"observed_at":"2026-07-31T20:06:18.144305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T18:36:23.555649Z","title":"arXiv preprint arXiv:2505.16410 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03468","last_updated":"2026-08-04T11:02:45Z","snapshot_observed_at":"2026-08-07T23:11:57.956397Z","submitted_at":"2026-08-04T11:02:45Z","title":"ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:23.555649Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2608.03468"},"observation_digest":"sha256:6072fdd74ce11ddf0dff4d486e06e02dc5ad0bfc5bd87d384809d2c13653dc05","observation_id":"f9f149f2-ea60-4886-ad4d-d4362bbd38fb","resolution":{"observed_at":"2026-08-05T18:36:23.555649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16410/citation-record","integrity":"/paper/2505.16410/integrity","json":"/paper/2505.16410/citation-record.json","paper":"/paper/2505.16410"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:02.921197Z","title":"Pan, Wen Zhang, Huajun Chen, Fan Yang, Zenan Zhou, and Weipeng Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:02.921197Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:427786f196c46c8dbba990282ba34bf106b33a5f36debc20cfe858ad1c331e48","observation_id":"a768c1a7-f587-45d9-afb8-9244aff5719c","resolution":{"observed_at":"2026-08-07T15:06:02.921197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:02.965213Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:02.965213Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:7a94106902e7e936625f17326512ab00649fe53ad0038fce6fc58f7a6d097243","observation_id":"9a52689b-1077-4ebc-ab31-0003e6de246c","resolution":{"observed_at":"2026-08-07T15:06:02.965213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T15:06:03.057637Z","title":"An empirical study on eliciting and improving r1-like reasoning models.CoRR, abs/2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.057637Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:a7520ee907182378e323a6ced5ab7ac4d85c30fae149f78eaaa3094c74a948c3","observation_id":"c5f52244-f3d1-4478-92df-621630b3f6d6","resolution":{"observed_at":"2026-08-07T15:06:03.057637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:06:03.258543Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.258543Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:12de33bfd8d64b0bc2ad21294eb8421874b81f0a85f6fa7ae6664ac74bbec18d","observation_id":"08d50b1f-5230-48c6-9bf5-b7e9303ae65f","resolution":{"observed_at":"2026-08-07T15:06:03.258543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T15:06:03.338887Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.338887Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:08d9dec24b6e5131572fbffadffeaadbb125bc186ac583bacbe8e0bd760fd429","observation_id":"6e0db75b-ba54-40fd-a9c3-04d5116bb108","resolution":{"observed_at":"2026-08-07T15:06:03.338887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:03.410193Z","title":"Reinforcement learning for reasoning in small llms: What works and what doesn’t","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.410193Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:a6960f9855643dea8404eeaee3c9b73b1eda08be693e1cbb29f75222704455bf","observation_id":"3f2a9b67-4572-412c-9ed6-5b8da5fb3627","resolution":{"observed_at":"2026-08-07T15:06:03.410193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.374632Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"3ab9c5c4-2eec-4815-bae2-be928d7bf4f2","year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.487236Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e77f6c64915b2e52e8b35a871d923e4b05fda86ada281547a5bb60914819ea4c","observation_id":"9db8e6d8-9076-4853-be05-13d988fca364","resolution":{"observed_at":"2026-08-07T15:06:09.377945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:03.575092Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.575092Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:78eadc5a0e9954b66eba49d54ebf57810335e73f38bbfb69df02e847e1198490","observation_id":"8a01c378-6eea-464c-945e-8b952fd37e6d","resolution":{"observed_at":"2026-08-07T15:06:03.575092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13542","last_updated":"2024-07-18T09:00:23Z","snapshot_observed_at":"2026-08-03T22:34:13.223301Z","submitted_at":"2024-06-19T13:29:53Z","title":"Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13542","snapshot_observed_at":"2026-08-07T15:06:03.644180Z","title":"Self-play with execution feedback: Improving instruction-following capabilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.644180Z"},"links":{"cited_paper":"/paper/2406.13542","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:f21e2ca9e400780261eef9c7321e893f15fac8cdbb22675a61500a95770e3a47","observation_id":"463ec17e-ac30-4bdb-8ea2-81a9d406ba19","resolution":{"observed_at":"2026-08-07T15:06:03.644180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:03.722976Z","title":"How abilities in large language models are affected by supervised fine-tuning data composition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.722976Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:0380cfb916ccc92a20d29c9f771dc74ed241f8861ac73f2ca5d86446d10a7e3c","observation_id":"59afab32-de7d-400d-9f4e-bda9cdd99418","resolution":{"observed_at":"2026-08-07T15:06:03.722976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14835","last_updated":"2024-12-19T13:25:39Z","snapshot_observed_at":"2026-08-07T13:31:49.205003Z","submitted_at":"2024-12-19T13:25:39Z","title":"Progressive Multimodal Reasoning via Active Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14835","snapshot_observed_at":"2026-08-07T15:06:03.782011Z","title":"Progressive multimodal reasoning via active retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.782011Z"},"links":{"cited_paper":"/paper/2412.14835","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:0a4e3258ba64945ec285266575d4572d5b64139b526694eb53c95e10407bc2e2","observation_id":"534947a6-a771-46e7-89c1-5c0506bb8b8a","resolution":{"observed_at":"2026-08-07T15:06:03.782011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18676","last_updated":"2024-07-18T08:28:09Z","snapshot_observed_at":"2026-07-06T18:37:34.799583Z","submitted_at":"2024-06-26T18:26:53Z","title":"Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18676","snapshot_observed_at":"2026-08-07T15:06:03.853422Z","title":"Understand what LLM needs: Dual preference alignment for retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.853422Z"},"links":{"cited_paper":"/paper/2406.18676","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:ae392945e426095a7fdf93c41488ff626fb427e213e684716759dd16a36e07b5","observation_id":"05b45d04-ff58-4c3c-9d94-db92a37592e5","resolution":{"observed_at":"2026-08-07T15:06:03.853422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:06:03.926256Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.926256Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:499228bbd0181a1e78e1d63f1bb904826e4ebb8e5338e92dfeceb757fb72e57f","observation_id":"3a8ccf65-cd6a-4971-93df-8ea0870efad9","resolution":{"observed_at":"2026-08-07T15:06:03.926256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.352997Z","title":"Concise reasoning via reinforcement learning, 2025","venue":null,"work_id":"e5a33d83-7014-41bc-b1a7-5c135795f12f","year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:03.998962Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:34c4e2de6ccf5c875e28f74eea4c819889780cedc944ef0a93084218233ea672","observation_id":"913923bf-d874-4927-8775-ad0923d608cb","resolution":{"observed_at":"2026-08-07T15:06:09.356157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:04.079207Z","title":"Retool: Reinforcement learning for strategic tool use in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.079207Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:d08e7c2bcd84289beef2133da6f8a03dd76c9742a7ebd2c07517d5ced7535f17","observation_id":"f7aea587-87f7-4ccd-9cd7-cf89a904e6da","resolution":{"observed_at":"2026-08-07T15:06:04.079207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.336291Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":"69fa3eba-80b9-4044-859f-ed4ce3da4c86","year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.133757Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:6ffae671430a01febbe071ad40e5a0e1e1905b0e02ff9cddcd15f0943e169a10","observation_id":"23cafa84-7db2-4b24-bf89-2225134fdcf0","resolution":{"observed_at":"2026-08-07T15:06:09.339342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:04.244504Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.244504Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:764f5ca0faa2eb9cee644e5cce8538131fc9690915f8e48c4e673b0dbfc05078","observation_id":"f0ec14f4-adee-4938-ae80-09f21d6f692b","resolution":{"observed_at":"2026-08-07T15:06:04.244504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:04.304466Z","title":"Constructing A multi- hop QA dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.304466Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:42636e1e9dec2942556be014c7fef4d2d931a700e0ea4628ec856d7f50446f2b","observation_id":"8458cacf-0f84-45b9-8de3-68df07e66012","resolution":{"observed_at":"2026-08-07T15:06:04.304466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T15:06:04.343006Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.343006Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:799cac34de96bb02004b0802fe35f508c627f156c9457c1cbac19f5fc3d60a21","observation_id":"f8588b63-1591-4eb6-bc10-acab3f7332ea","resolution":{"observed_at":"2026-08-07T15:06:04.343006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:04.459705Z","title":"Towards reasoning in large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.459705Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:bfa8260da85f7479a6d8505fa4ce0f9977f04a9044905ca4a731528de9743837","observation_id":"e9160051-d954-4e11-b638-b95197f87cbb","resolution":{"observed_at":"2026-08-07T15:06:04.459705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12881","last_updated":"2024-12-17T13:05:36Z","snapshot_observed_at":"2026-07-06T20:08:34.216137Z","submitted_at":"2024-12-17T13:05:36Z","title":"RAG-Star: Enhancing Deliberative Reasoning with Retrieval Augmented Verification and Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12881","snapshot_observed_at":"2026-08-07T15:06:04.555452Z","title":"Rag-star: Enhancing deliberative reasoning with retrieval augmented verification and refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.555452Z"},"links":{"cited_paper":"/paper/2412.12881","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:f1607dd5bae475f7e855f98088431c63ff3787e61e90928448bf630ff3564024","observation_id":"3cddfc57-598a-4628-8a98-68a78fd6e4d9","resolution":{"observed_at":"2026-08-07T15:06:04.555452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T15:06:04.638038Z","title":"Search- r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.638038Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:a829e11c02ce1765a09d77ddf8f941e667e6c6c494e296bf37e6e6fb6042af56","observation_id":"bffe5425-3732-4e3f-9c2d-fde963dae4b9","resolution":{"observed_at":"2026-08-07T15:06:04.638038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13576","last_updated":"2025-02-24T02:46:52Z","snapshot_observed_at":"2026-07-06T18:17:54.712067Z","submitted_at":"2024-05-22T12:12:40Z","title":"FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13576","snapshot_observed_at":"2026-08-07T15:06:04.709451Z","title":"Flashrag: A modular toolkit for efficient retrieval-augmented generation research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.709451Z"},"links":{"cited_paper":"/paper/2405.13576","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:f11103778f2293f584bca1bb57b29e0ff7b9c6a81d1f3e374a1959124234df95","observation_id":"83ed383c-4019-413e-a777-e91fd6877bd9","resolution":{"observed_at":"2026-08-07T15:06:04.709451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11911","last_updated":"2024-08-29T05:14:36Z","snapshot_observed_at":"2026-07-06T16:21:41.556117Z","submitted_at":"2023-09-21T09:22:07Z","title":"InstructERC: Reforming Emotion Recognition in Conversation with Multi-task Retrieval-Augmented Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11911","snapshot_observed_at":"2026-08-07T15:06:04.761722Z","title":"Instructerc: Reforming emotion recognition in conversation with a retrieval multi-task llms framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.761722Z"},"links":{"cited_paper":"/paper/2309.11911","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:27466a6ebb8458f32669a272f3055a9b011316b9611ef9345640c063a5cfb121","observation_id":"200f13a6-785c-47f8-b91a-5eff891f837a","resolution":{"observed_at":"2026-08-07T15:06:04.761722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.308334Z","title":"Retrieval-augmented generation for knowledge-intensive NLP tasks","venue":null,"work_id":"1f703b70-4cae-43fd-9aeb-d840ebdb8eac","year":2020},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.856927Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:88a9ad7f9e3a326f3e7527fe8fae67da85a783690e23de3a717281099411595f","observation_id":"8416c664-e224-46e3-a43d-0bdebc16618d","resolution":{"observed_at":"2026-08-07T15:06:09.311394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04078","last_updated":"2024-07-17T13:13:05Z","snapshot_observed_at":"2026-08-04T11:24:05.634473Z","submitted_at":"2024-07-04T17:39:16Z","title":"DotaMath: Decomposition of Thought with Code Assistance and Self-correction for Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04078","snapshot_observed_at":"2026-08-07T15:06:04.931191Z","title":"Dotamath: Decomposition of thought with code assistance and self-correction for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:04.931191Z"},"links":{"cited_paper":"/paper/2407.04078","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:f3c65829b6e44f6cf4be56d19daaf8b7bf720b20db978af57f30efa8c3c8d6a3","observation_id":"daa241b4-b288-4055-81b0-54ead7f9de7c","resolution":{"observed_at":"2026-08-07T15:06:04.931191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04625","last_updated":"2025-03-07T18:13:22Z","snapshot_observed_at":"2026-08-07T17:24:07.321477Z","submitted_at":"2025-03-06T17:11:51Z","title":"START: Self-taught Reasoner with Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04625","snapshot_observed_at":"2026-08-07T15:06:05.048539Z","title":"START: self-taught reasoner with tools","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.048539Z"},"links":{"cited_paper":"/paper/2503.04625","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e07b12d5ab75c3e6cf9bd7d576fed1aecfc310b13bdeedb3bfa606055d209f27","observation_id":"25f7b39c-0cb8-4f13-a9ed-05c22fd440b6","resolution":{"observed_at":"2026-08-07T15:06:05.048539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.298748Z","title":"Chain of code: Reasoning with a language model-augmented code emulator","venue":null,"work_id":"06db6d16-6eb1-4006-9519-31126d5daaea","year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.120040Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:ea63afd38f66f240bffb703ef900644b1dc5b07436d0365abcae5bdf6c21a1c3","observation_id":"283ff077-586d-43e1-8ac4-58ba3cee46c4","resolution":{"observed_at":"2026-08-07T15:06:09.302008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-07T15:06:05.190265Z","title":"Search-o1: Agentic search-enhanced large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.190265Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:5dc363e3e50379f9bb91f0c81214b7a4e266054a14aaa9a34af6b5f783d6dfa6","observation_id":"57c7b695-3dee-4172-bfcc-48b6d2e5a6fe","resolution":{"observed_at":"2026-08-07T15:06:05.190265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21776","snapshot_observed_at":"2026-08-07T15:06:05.232033Z","title":"Webthinker: Empowering large reasoning models with deep research capability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.232033Z"},"links":{"cited_paper":"/paper/2504.21776","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:8d54f3b79f59456d250f5d594f8c3c78024df66025b253018b9bd3e89016fa92","observation_id":"04539f72-ae22-48f5-b753-e1a7d0010b5e","resolution":{"observed_at":"2026-08-07T15:06:05.232033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11919","last_updated":"2024-12-16T16:03:25Z","snapshot_observed_at":"2026-08-04T12:25:37.009975Z","submitted_at":"2024-12-16T16:03:25Z","title":"RetroLLM: Empowering Large Language Models to Retrieve Fine-grained Evidence within Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11919","snapshot_observed_at":"2026-08-07T15:06:05.273622Z","title":"Retrollm: Empowering large language models to retrieve fine-grained evidence within genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.273622Z"},"links":{"cited_paper":"/paper/2412.11919","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:38e1425cdcd97f8252393854c32b6f0b34c5fc2020a95c4cf8decbb049a84717","observation_id":"3575f901-c584-4012-9934-210449d77720","resolution":{"observed_at":"2026-08-07T15:06:05.273622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-07T18:12:08.883357Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T15:06:05.361350Z","title":"LIMR: less is more for RL scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.361350Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:5e6f46373c100a4a16fc3e854dc1cbe22f5fd027287895d91b2621424234cbd3","observation_id":"d0dcaede-b418-4ca1-974f-bb7ca676e1a3","resolution":{"observed_at":"2026-08-07T15:06:05.361350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T15:06:05.394679Z","title":"Torl: Scaling tool-integrated RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.394679Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e69bfa0a48d3cc69ef966eed9a83b0c13df2f2c410eb91b7f879b41eaac99213","observation_id":"34f7b3a3-7b5c-4681-948c-188b4fc6f61e","resolution":{"observed_at":"2026-08-07T15:06:05.394679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T15:06:05.495850Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.495850Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:7ba485eb0475e5ea480dcf40c9202d75e3da8670b7762bcf5cfad1a9c84a34c2","observation_id":"745a06c8-a473-4d00-abe6-0858cc0119fd","resolution":{"observed_at":"2026-08-07T15:06:05.495850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.288657Z","title":"Let’s verify step by step","venue":null,"work_id":"d65c3fb5-344d-4fc4-a9a1-cf7c3959a357","year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.585309Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:bf5b9a8de9fb46475b5aaebca7260bd06b41a968bd9625b7df92fb24e99f20e1","observation_id":"aea5fb85-94ca-4a23-9392-ebdc726e520c","resolution":{"observed_at":"2026-08-07T15:06:09.292687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11271","last_updated":"2026-04-13T23:08:01Z","snapshot_observed_at":"2026-08-03T02:43:16.180683Z","submitted_at":"2025-02-16T21:18:47Z","title":"OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11271","snapshot_observed_at":"2026-08-07T15:06:05.698406Z","title":"Octotools: An agentic framework with extensible tools for complex reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.698406Z"},"links":{"cited_paper":"/paper/2502.11271","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:96db4fb16f24bbf50b9ce7c9d15fa2b65a28a8ed3284d6d0563c506754dfa0e9","observation_id":"6b7fd29a-5863-4e42-96ef-e1de6797f489","resolution":{"observed_at":"2026-08-07T15:06:05.698406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.277124Z","title":"GAIA: a benchmark for general AI assistants","venue":null,"work_id":"5c042c30-1d57-461a-87f9-b4fdfae16cf0","year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.804990Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:12fc1ee4475ec8eb260aa35ce3aafa32bcef6c9e902024198817e7d6779f9506","observation_id":"445726c9-8530-4733-8eca-b261283df9e9","resolution":{"observed_at":"2026-08-07T15:06:09.280556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T15:06:05.887519Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.887519Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:cb50916634c337706c76201702d34983cff9faffdedcfca84f45212cee3794b2","observation_id":"93a9665b-d25d-40fa-bd45-651c6f9aef19","resolution":{"observed_at":"2026-08-07T15:06:05.887519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:05.988114Z","title":"Learning to reason with llms, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.988114Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:19a82a53e4e024dec3f2d1cf70da9b49b14ed2d61bfbffb133acd6c07581f446","observation_id":"cf84693b-90e0-48cd-a54a-a6034290062d","resolution":{"observed_at":"2026-08-07T15:06:05.988114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09014","last_updated":"2023-03-16T01:04:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T01:04:45Z","title":"ART: Automatic multi-step reasoning and tool-use for large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09014","snapshot_observed_at":"2026-08-07T15:06:06.095753Z","title":"Lundberg, Sameer Singh, Hannaneh Hajishirzi, Luke Zettlemoyer, and Marco Túlio Ribeiro","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.095753Z"},"links":{"cited_paper":"/paper/2303.09014","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:94292f00d778ec271d1aa651639ab564c402918504e1a2afc2e0744135c3a0a6","observation_id":"3144e645-50d1-48ce-885a-71094a43d092","resolution":{"observed_at":"2026-08-07T15:06:06.095753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T15:06:06.199430Z","title":"Feng, Haoran Zhao, Michael Yu, Varun Gangal, Chelsea Zou, Zihan Wang, Jessica P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.199430Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:3fc1594b2fb24d2480e2f11d3dbbdd520aeadd8fc3c048cdcca954a813623dac","observation_id":"5f3d20e1-635b-4c5d-a32f-33d56633289f","resolution":{"observed_at":"2026-08-07T15:06:06.199430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:06.237798Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.237798Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:3a1a6983de11fb3f6ef1c7b3713a187a5d994c7e59d60530ab240e7901a932e0","observation_id":"b8539a7f-3075-48f5-bbce-6105aff6cb86","resolution":{"observed_at":"2026-08-07T15:06:06.237798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T15:06:06.338068Z","title":"Toolrl: Reward is all tool learning needs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.338068Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:26a0bc79a08171b0f6f7e4d5cf4f23bae5e5e6090f93b136e06b06ca5f30c75c","observation_id":"b5233d9b-b8cd-4656-88ee-e72349f1e852","resolution":{"observed_at":"2026-08-07T15:06:06.338068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.256056Z","title":"Toolrl: Reward is all tool learning needs, 2025","venue":null,"work_id":"601ff242-f88b-48f2-83e5-135db8732315","year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.394366Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:f1ea6b2fc9fac914dc02f1194683f37e38ee2ab82d7292fd744069dd701301c6","observation_id":"a7298ef0-0a11-46c6-a798-9ec61ac14a85","resolution":{"observed_at":"2026-08-07T15:06:09.259059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T15:06:06.397967Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? CoRR, abs/2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.397967Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:391cf2fb74d89f921cce81e6473494c49e5cb7bbe8bf99b5b49c6b7047d03237","observation_id":"0a372f50-8758-4b4f-b9b3-60ce4a8d6509","resolution":{"observed_at":"2026-08-07T15:06:06.397967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-07T15:06:06.440420Z","title":"O1 replication journey: A strategic progress report–part 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.440420Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:9961e59d928f12183f2e0f08c8bec294c0393095a905852a4672d820e0c23c90","observation_id":"0adb45c0-3add-4d97-9c99-26536730064d","resolution":{"observed_at":"2026-08-07T15:06:06.440420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:06.491523Z","title":"Qwen2.5 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.491523Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:628701d3c4ddf296cf49f61ccb732de76959f8577eee0ea09e367f4ad8677385","observation_id":"2997ecbc-83d1-4c34-bf61-4ee3967d1677","resolution":{"observed_at":"2026-08-07T15:06:06.491523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.240388Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"615974ff-0475-46da-a427-84900e3c625f","year":2020},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.528602Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:8243d8a6b915e7d9f6f0b5047aa802ce6cc2be102cdeb0c135d7079e4eace996","observation_id":"f7e10529-5f86-489a-8250-4815c38c2293","resolution":{"observed_at":"2026-08-07T15:06:09.244120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:06:06.594525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.594525Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:242823951c3e4eec7f54569f795de896437ebafe88dd5e20dc778b29b431be16","observation_id":"c0e5f2f0-0796-41dc-aa5e-5b70c7d0bdbd","resolution":{"observed_at":"2026-08-07T15:06:06.594525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-08-05T20:36:54.358831Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-08-07T15:06:06.664381Z","title":"Agentic reasoning and tool integration for llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.664381Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:60c04bb92def6adeba03a57c0413024e54ae6d8d76fdf3203158b4b680c015b5","observation_id":"00a5d9b7-a885-40fe-b01c-681f3acdd004","resolution":{"observed_at":"2026-08-07T15:06:06.664381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T15:06:06.718929Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.718929Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:9254f0a7aa23c433b06bc66e61985e64939f9915c1a2a3105395288e614d0bc9","observation_id":"93374031-0617-423a-82a1-ccf6d4d99499","resolution":{"observed_at":"2026-08-07T15:06:06.718929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.230321Z","title":"Curriculum learning: A survey","venue":null,"work_id":"986421c8-8656-42ae-82e8-d599227c69a9","year":2022},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.770243Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:a71efad3c4366dae5b67ec5f2b1e59135a14ba084b94fe8f17d77be21a895d19","observation_id":"3fc324cf-9944-49e5-aea7-6b77dd04f0ab","resolution":{"observed_at":"2026-08-07T15:06:09.233430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-07T15:06:06.794401Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.794401Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:8dac5f8274fceb9e8250457426aa5dadfc51e84d99715a40922c9d7979804a57","observation_id":"a1453fd0-e7d7-43f6-806d-6f5e890cfc88","resolution":{"observed_at":"2026-08-07T15:06:06.794401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:06.835005Z","title":"Zerosearch: Incentivize the search capability of llms without searching, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.835005Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:66c03fe1a7afb25b0c3fc0173c07cce0bc0d8eeb109a36db0e86dc927696a215","observation_id":"c7c6dfe8-d0b4-4b8e-8f90-86b78c232e7b","resolution":{"observed_at":"2026-08-07T15:06:06.835005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11562","last_updated":"2024-01-25T11:20:16Z","snapshot_observed_at":"2026-08-08T01:09:26.414662Z","submitted_at":"2023-12-17T15:16:13Z","title":"A Survey of Reasoning with Foundation Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11562","snapshot_observed_at":"2026-08-07T15:06:06.912225Z","title":"A survey of reasoning with foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.912225Z"},"links":{"cited_paper":"/paper/2312.11562","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:58b137f76f1fdb066537c47edad7452a37f1c44cf21c03f2b92ef9a31f3a20eb","observation_id":"c6e6190f-f8ce-4ad7-b7b1-f53ae29ec45d","resolution":{"observed_at":"2026-08-07T15:06:06.912225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.214517Z","title":"Simpledeepsearcher: Deep information seeking via web-powered reasoning trajectory synthesis","venue":null,"work_id":"f972c007-05cd-471f-9059-6c3792638c70","year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:06.939970Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:a929ee559948ba4aa7a5061003bf40b201b8a7d1dadaf42bebe6b06227ef7be4","observation_id":"98a456f2-71ba-4ab3-acf7-9470f5701e26","resolution":{"observed_at":"2026-08-07T15:06:09.217964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T15:06:07.075956Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:07.075956Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:0e5e278df768ce826acb3938ddf32a67edc0536360452535c631385625dd60b5","observation_id":"2c61a8ef-fdc0-4fec-bd37-f51574ecfb16","resolution":{"observed_at":"2026-08-07T15:06:07.075956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:07.190061Z","title":"Qwq: Reflect deeply on the boundaries of the unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:07.190061Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e83590fc45f2fcc698c2350c17e65960557e49efc7bf7c771c7ede5b58a3b79a","observation_id":"c4530ae1-730f-487c-b9de-cd35b72a215c","resolution":{"observed_at":"2026-08-07T15:06:07.190061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:06:07.292322Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:07.292322Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:f74fde5a1f135cb9626fd413d9c5d888a95f82734d4582c3fc8b8318d66d6d3e","observation_id":"8e086096-b12f-4f26-82b3-691746961c7b","resolution":{"observed_at":"2026-08-07T15:06:07.292322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10509","last_updated":"2023-06-23T00:59:13Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:26:34Z","title":"Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10509","snapshot_observed_at":"2026-08-07T15:06:07.353123Z","title":"Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:07.353123Z"},"links":{"cited_paper":"/paper/2212.10509","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:fc74fe567571ac45414b4dff0247f29f7a30e18351e3d508572e3ecd50eefb30","observation_id":"41c61fc1-3617-4a5e-a0f4-9210c9366594","resolution":{"observed_at":"2026-08-07T15:06:07.353123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:07.492226Z","title":"musique: Multihop questions via single-hop question composition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:07.492226Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:6346fe557ea13dfa9f0067560ebdf1cf65b4a8b99f2356add870a450db3c1fdc","observation_id":"291d80f0-80dc-4ebd-a067-e19d68876a68","resolution":{"observed_at":"2026-08-07T15:06:07.492226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14870","last_updated":"2025-05-31T20:08:42Z","snapshot_observed_at":"2026-08-08T02:02:02.959157Z","submitted_at":"2025-04-21T05:40:05Z","title":"Acting Less is Reasoning More! Teaching Model to Act Efficiently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14870","snapshot_observed_at":"2026-08-07T15:06:07.633692Z","title":"Otc: Optimal tool calls via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:07.633692Z"},"links":{"cited_paper":"/paper/2504.14870","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e774f4d2e482e634f02e7c5eaec9007b48b0eb69f72cf432e64d4b976456a42c","observation_id":"e3927b1f-8cf6-41e1-a29e-5b85e26a419c","resolution":{"observed_at":"2026-08-07T15:06:07.633692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:07.793407Z","title":"Text embeddings by weakly-supervised contrastive pre-training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:07.793407Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:99b0d0fb40c7b4ef108589af86f314f34b9a960fab23c6f751c3e2393483bbc7","observation_id":"abd5b097-0a92-431b-afce-308df4f64937","resolution":{"observed_at":"2026-08-07T15:06:07.793407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:07.888830Z","title":"Reinforcement learning for reasoning in large language models with one training example, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:07.888830Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e03d84ada33f62bedcc5573996ad6f026158033358eee1c637f088435cf85cf2","observation_id":"6865c8fb-0fe2-458f-82c7-17d3d5577937","resolution":{"observed_at":"2026-08-07T15:06:07.888830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.179713Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning, 2025","venue":null,"work_id":"7c730cef-f501-4994-adf8-66561779e014","year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.048505Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e300fe4366dfffca597a53b2d6dbda9986b7cfdd2536762f2afdcd453401bf1e","observation_id":"1c6d98e7-73d1-4a9f-823c-a9a0497ebfc8","resolution":{"observed_at":"2026-08-07T15:06:09.183390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07572","last_updated":"2025-08-10T05:59:20Z","snapshot_observed_at":"2026-08-04T14:46:05.418102Z","submitted_at":"2025-01-13T18:58:07Z","title":"WebWalker: Benchmarking LLMs in Web Traversal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07572","snapshot_observed_at":"2026-08-07T15:06:08.136388Z","title":"Webwalker: Benchmarking llms in web traversal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.136388Z"},"links":{"cited_paper":"/paper/2501.07572","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:3e9b1bbb69cea25c5064c13f99c78f87bafac9d48eff98cae3a03e6fda2af6cf","observation_id":"ce961658-b063-4860-8900-c03507313a72","resolution":{"observed_at":"2026-08-07T15:06:08.136388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04644","last_updated":"2025-07-14T20:06:23Z","snapshot_observed_at":"2026-07-06T20:32:39.321377Z","submitted_at":"2025-02-07T04:08:46Z","title":"Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04644","snapshot_observed_at":"2026-08-07T15:06:08.224735Z","title":"Agentic reasoning: Reasoning llms with tools for the deep research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.224735Z"},"links":{"cited_paper":"/paper/2502.04644","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:6347c83acd9af6d2b2ef5b72d12b6a9fad2012255885566a4143823f806f16b8","observation_id":"fc269afc-78f1-4380-933b-e35f5fe7a0d2","resolution":{"observed_at":"2026-08-07T15:06:08.224735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T15:06:08.283937Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.283937Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:2f9003c7dd2f0dda1fa33817a251e3b8c19b0711b8fa0700eea79f3951f52a6e","observation_id":"2fc8f876-fd04-4022-a5c7-510118aae02a","resolution":{"observed_at":"2026-08-07T15:06:08.283937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T15:06:08.324488Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.324488Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:fc48f140347627b9a004f072c372d9d91663af9253dbbf5f0952116fc7828f5e","observation_id":"b498f759-afe6-4708-9ac1-e06713c18d97","resolution":{"observed_at":"2026-08-07T15:06:08.324488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19411","last_updated":"2025-02-26T18:55:42Z","snapshot_observed_at":"2026-08-07T17:45:14.260418Z","submitted_at":"2025-02-26T18:55:42Z","title":"Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19411","snapshot_observed_at":"2026-08-07T15:06:08.363789Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.363789Z"},"links":{"cited_paper":"/paper/2502.19411","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:d8552f9016291cbbbcf98bd1cce827ed0d6c8aa0133485cbb0c0401e71f24315","observation_id":"307a74a1-7a9a-47b0-b6d7-5d55cb513d6a","resolution":{"observed_at":"2026-08-07T15:06:08.363789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:08.408176Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.408176Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:8eddffa32c29b039cedd8c37257e3a03567ce4f228926c5126f0a3044107d698","observation_id":"e548cbf4-4dc3-4a94-8cd7-2d6e1c820185","resolution":{"observed_at":"2026-08-07T15:06:08.408176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T15:06:08.440907Z","title":"LIMO: less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.440907Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:70ee0d2af90420001f6b9532ab08417439ef7b81600b10b7e43d1bddd83a8a86","observation_id":"81248e37-f9ac-4e80-a775-969a6c60d58d","resolution":{"observed_at":"2026-08-07T15:06:08.440907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12090","last_updated":"2025-02-23T06:55:10Z","snapshot_observed_at":"2026-08-05T11:10:44.135200Z","submitted_at":"2023-04-24T13:35:11Z","title":"Reinforcement Learning with Knowledge Representation and Reasoning: A Brief Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12090","snapshot_observed_at":"2026-08-07T15:06:08.455553Z","title":"Reinforcement learning with knowledge representation and reasoning: A brief survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.455553Z"},"links":{"cited_paper":"/paper/2304.12090","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:ca5b7c8d061cb2868b2835fe228bb26d256cb027bf893781bd3b6162b4abe4e5","observation_id":"d4d0aa70-6d7d-4dfd-a556-9709db7a630e","resolution":{"observed_at":"2026-08-07T15:06:08.455553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15565","last_updated":"2024-08-28T06:33:03Z","snapshot_observed_at":"2026-08-04T18:13:48.191539Z","submitted_at":"2024-08-28T06:33:03Z","title":"SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models","version":1},"cited_work":{"arxiv_id":"2408.15565","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15565","snapshot_observed_at":"2026-08-07T15:06:08.647271Z","title":"SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models","venue":"cs.CL","work_id":"a6d6f878-2b3b-4090-83c6-1b972e287380","year":2024},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.459251Z"},"links":{"cited_paper":"/paper/2408.15565","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:c4c04c70addf70b08eb92cb0bf13f02cf3044cc69775d561cadb7c2403c2f5ae","observation_id":"c60b9b13-4423-4230-8314-19ace93877e5","resolution":{"observed_at":"2026-08-07T15:06:08.651537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:06:08.462641Z","title":"DAPO: an open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.462641Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:8458d421478b91ae1cad47608bedd815521977dd4f737367fa42d9dcbf519aae","observation_id":"4ee74034-adfa-4c42-8c6b-7a8371bd8dbd","resolution":{"observed_at":"2026-08-07T15:06:08.462641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T15:06:08.466277Z","title":"Scaling relationship on learning mathematical reasoning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.466277Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:ccf3d242805e4e8147bf59b3344c18bb2fadab30cf6f4dd3f16d3221159f2250","observation_id":"981b328b-5cad-4846-a3ff-9e4652bff27c","resolution":{"observed_at":"2026-08-07T15:06:08.466277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T15:06:08.469560Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.469560Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:4cf92491d0167973efadb103b3aacefcae4daebfbba6a3514f8f58fdf11b6d30","observation_id":"d58cba6d-1eda-493c-91ec-c37fb3e07075","resolution":{"observed_at":"2026-08-07T15:06:08.469560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06580","last_updated":"2025-03-09T12:19:47Z","snapshot_observed_at":"2026-08-07T17:19:04.273814Z","submitted_at":"2025-03-09T12:19:47Z","title":"Agent models: Internalizing Chain-of-Action Generation into Reasoning models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06580","snapshot_observed_at":"2026-08-07T15:06:08.472839Z","title":"Agent models: Inter- nalizing chain-of-action generation into reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.472839Z"},"links":{"cited_paper":"/paper/2503.06580","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:aabe0c57b6f973ecd6ea91ce943394339ab7f8e31b375e477d43d0603d91cd74","observation_id":"ba4b92eb-7b3e-4d32-9517-c76a3d75a398","resolution":{"observed_at":"2026-08-07T15:06:08.472839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-07T15:06:08.476018Z","title":"Scaling Analysis on Parameter Scales","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.476018Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:755405a3cbd7b7544e353787391fa3e5823ba4559c8a4200d5222d7c4817bf61","observation_id":"23835f8d-1b01-4f55-8421-2fea2308e4d4","resolution":{"observed_at":"2026-08-07T15:06:08.476018Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.161857Z","title":"- t: Time spent in the coffee shop in minutes (which needs to be converted to hours since the other times are in hours)","venue":null,"work_id":"1ad18b4e-b9e2-4ca8-b166-e052e1923f6d","year":null},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.479995Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:27c6ee2bd62f282252aab96ad0300c805de066191acba5a569d33b169bd029b7","observation_id":"98931d4b-53cc-4d13-815c-8d322e3a3bf0","resolution":{"observed_at":"2026-08-07T15:06:09.167010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:09.151736Z","title":"Converting t minutes to hours, we get t 60","venue":null,"work_id":"7a84b6f1-36cc-4391-92a2-af95f41e39f2","year":null},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.483160Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:abf392d4ea7cb50658162d15d0ef1053d6750c17ec4efc4ef1e4f5da6cf17e22","observation_id":"be2b3f86-a863-4906-a4a4-aec64f33799c","resolution":{"observed_at":"2026-08-07T15:06:09.155451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1428.42857","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:06:08.577629Z","title":"{numerator}/{denominator}","venue":null,"work_id":"f7b81204-7b4a-4695-b79e-b3ace497c0de","year":null},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:08.486342Z"},"links":{"citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:ef8fc407be2e975d949908e666c571880d6f36ed9647230189b83a4bc17ce94d","observation_id":"e10bd72b-7cc0-464e-9a4c-f2c71d769f71","resolution":{"observed_at":"2026-08-07T15:06:08.583497Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 38 inbound Pith citation observations for arXiv:2505.16410."}