{"as_of":"2026-08-09T03:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e74da2baaff20e670dfafff3320dfd81eedfbb0ceffa02466b4f9c641706eccc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":77,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:49:39.554840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T18:42:39.023650Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2504.11536"},"observation_digest":"sha256:a1fa6c5b429d6618b1eae94f635a14215898bb33e6b278716c7c32b900a6433b","observation_id":"c0ec26f3-934f-475c-a272-d028e2921326","resolution":{"observed_at":"2026-05-13T18:42:39.069463Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T19:14:25.283645Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2504.21776"},"observation_digest":"sha256:2cd418ecda92d9507c40920c05cce8fb0490fc6819dca4798387346bc3b0efff","observation_id":"7df66722-4f73-4a07-886d-78b479392da2","resolution":{"observed_at":"2026-05-16T19:14:25.328698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T15:42:27.826306Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-07T17:35:55.668492Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.826306Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:e9b54a5af929689e8c2fd2ce76a2f24335ad650506a469ad75caadc0127ec551","observation_id":"242dc923-cbeb-4a5f-93d5-edf32159a6d5","resolution":{"observed_at":"2026-08-07T15:42:27.826306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T15:06:05.394679Z","title":"Torl: Scaling tool-integrated RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.394679Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e69bfa0a48d3cc69ef966eed9a83b0c13df2f2c410eb91b7f879b41eaac99213","observation_id":"34f7b3a3-7b5c-4681-948c-188b4fc6f61e","resolution":{"observed_at":"2026-08-07T15:06:05.394679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:58:16.110667Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16810","last_updated":"2025-05-26T08:51:17Z","snapshot_observed_at":"2026-08-07T20:42:39.359884Z","submitted_at":"2025-05-22T15:49:38Z","title":"DeepRec: Towards a Deep Dive Into the Item Space with Large Language Model Based Recommendation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:16.110667Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.16810"},"observation_digest":"sha256:22a5a1dd079c531854363386eda2d693565f893e58c108aebbac2badaddb9b6d","observation_id":"f88a0921-bfd6-4689-b5af-88624a1ad566","resolution":{"observed_at":"2026-08-07T14:58:16.110667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:21:19.031069Z","title":"Torl: Scaling tool-integrated RL.CoRR, abs/2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19300","last_updated":"2025-05-25T20:20:04Z","snapshot_observed_at":"2026-08-07T14:15:00.365333Z","submitted_at":"2025-05-25T20:20:04Z","title":"SituatedThinker: Grounding LLM Reasoning with Real-World through Situated Thinking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:19.031069Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.19300"},"observation_digest":"sha256:15086349adf8b8292616ddf2418691f7a0b744a167a2e49222f8291c945a27cd","observation_id":"79512292-bbd6-4bc9-af93-958343527375","resolution":{"observed_at":"2026-08-07T14:21:19.031069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:05:20.079725Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20128","last_updated":"2025-05-26T15:27:55Z","snapshot_observed_at":"2026-08-07T20:40:53.191299Z","submitted_at":"2025-05-26T15:27:55Z","title":"Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:20.079725Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.20128"},"observation_digest":"sha256:b1cab690b9b71caa8a2073c55f639fff19cbf75140b8b34f108c95f1aee40881","observation_id":"5ce54d20-9228-4fce-bc41-0c6183dc2f59","resolution":{"observed_at":"2026-08-07T14:05:20.079725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:01:12.497316Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20296","last_updated":"2025-05-26T17:59:53Z","snapshot_observed_at":"2026-08-07T20:41:25.052132Z","submitted_at":"2025-05-26T17:59:53Z","title":"Reasoning LLMs are Wandering Solution Explorers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:12.497316Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.20296"},"observation_digest":"sha256:6dd318feb0ab1de4d1b7b799fa771f56e6f07f1883a4588bad8727583632802d","observation_id":"7dd91fe7-fa36-4dd1-b7cf-d4b0f6f84d79","resolution":{"observed_at":"2026-08-07T14:01:12.497316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:25:26.808955Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24480","last_updated":"2025-05-30T11:30:18Z","snapshot_observed_at":"2026-08-07T20:40:53.644357Z","submitted_at":"2025-05-30T11:30:18Z","title":"Towards Effective Code-Integrated Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:25:26.808955Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24480"},"observation_digest":"sha256:645b61435fd778e57e2adf48ddfff078e0ff7c065418544380451f2d4d4437bb","observation_id":"91035334-31c4-4bf9-8900-7c926ce8639f","resolution":{"observed_at":"2026-08-07T12:25:26.808955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:35:37.503027Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.503027Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:8bf8d3228d2b8b784db268386c9ccc67b6fca27c53f027becb9696bee072cd76","observation_id":"0b82f9e9-4aab-4d41-aa95-17b48f455999","resolution":{"observed_at":"2026-08-07T12:35:37.503027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:16:23.665196Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.665196Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:d739c7f109fadbaa96c0f6ca58e226091c6ce54a569dc653fd9de811cb04dbdb","observation_id":"f7e5c7f2-04d0-407f-88fc-59ac5af16301","resolution":{"observed_at":"2026-08-07T12:16:23.665196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T05:14:47.327873Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-07T09:15:20.058485Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:47.327873Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:522a48e938d75d9c908adb7f4dc0efc7664f3959e7545af07f9e62bcad644850","observation_id":"aca1611a-9a7e-42cc-aac2-3e1b73269c53","resolution":{"observed_at":"2026-08-07T05:14:47.327873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T04:43:18.797764Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09942","last_updated":"2025-06-11T17:10:36Z","snapshot_observed_at":"2026-08-07T04:34:42.506782Z","submitted_at":"2025-06-11T17:10:36Z","title":"VerIF: Verification Engineering for Reinforcement Learning in Instruction Following","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:18.797764Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.09942"},"observation_digest":"sha256:f112158ef63fee4d8952d8877c13e4ea4b17e873077c74f4cbee1b290b77a3ee","observation_id":"215f307f-beb2-4e89-8e06-91b84257bee5","resolution":{"observed_at":"2026-08-07T04:43:18.797764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T00:48:20.031722Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-07T11:53:13.790399Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:20.031722Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.12594"},"observation_digest":"sha256:0947eea22f5af56978f06eb80e607acf2e5cfef9d79926ec428db61334cf9f04","observation_id":"601b0de8-2bed-4708-a7fe-8102af2e7d01","resolution":{"observed_at":"2026-08-07T00:48:20.031722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T00:34:31.307164Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.307164Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3e640a22d68cdf354b046b3724cbba5206ad683101281c3417a8d83d25d182ac","observation_id":"be98b4be-dba1-44c8-bb83-0f574e20da63","resolution":{"observed_at":"2026-08-07T00:34:31.307164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T23:35:04.518537Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17644","last_updated":"2025-06-21T08:56:20Z","snapshot_observed_at":"2026-08-07T23:27:30.726322Z","submitted_at":"2025-06-21T08:56:20Z","title":"Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:04.518537Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.17644"},"observation_digest":"sha256:571e6e347929a1e3d94af2a3d40d9d56cbce3691aa75c90bb0cf9d22c6b301cc","observation_id":"7c9e36bc-fb98-4b7f-90c5-0b5834acc2fa","resolution":{"observed_at":"2026-08-06T23:35:04.518537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T23:11:58.308371Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19171","last_updated":"2025-06-23T22:10:38Z","snapshot_observed_at":"2026-08-08T10:48:33.185126Z","submitted_at":"2025-06-23T22:10:38Z","title":"Distilling Tool Knowledge into Language Models via Back-Translated Traces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:58.308371Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.19171"},"observation_digest":"sha256:a9eef313ac64b69875c6627bc9be3a228d82d70628433006157a75865a4af934","observation_id":"5d1b38b3-89b2-4ed8-a746-8d265c087767","resolution":{"observed_at":"2026-08-06T23:11:58.308371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T19:16:12.930533Z","title":"Torl: Scaling tool-integrated rl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06127","last_updated":"2025-07-08T16:14:17Z","snapshot_observed_at":"2026-08-08T15:07:59.924275Z","submitted_at":"2025-07-08T16:14:17Z","title":"PrefixAgent: An LLM-Powered Design Framework for Efficient Prefix Adder Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:12.930533Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2507.06127"},"observation_digest":"sha256:ec8a5c440c18921dfa2b4c02ffaae85a42fe3707874c45b64fd8c1d75a9b2e4a","observation_id":"380fa6b6-651c-49c2-94f3-e4a6ef083491","resolution":{"observed_at":"2026-08-06T19:16:12.930533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T13:47:38.217893Z","title":"ToRL: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20199","last_updated":"2025-08-13T10:58:50Z","snapshot_observed_at":"2026-08-07T10:10:33.604674Z","submitted_at":"2025-07-27T09:38:32Z","title":"StepFun-Prover Preview: Let's Think and Verify Step by Step","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:47:38.217893Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2507.20199"},"observation_digest":"sha256:2c0dcfe888a204ec9811d99aff4180abf001394dac2a8d0f940b126012ba75a2","observation_id":"05729999-5f89-4d04-a2cb-2cda13c47ab4","resolution":{"observed_at":"2026-08-06T13:47:38.217893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T12:23:55.175839Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21836","last_updated":"2025-07-29T14:12:28Z","snapshot_observed_at":"2026-08-07T20:39:44.012130Z","submitted_at":"2025-07-29T14:12:28Z","title":"AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T12:23:55.175839Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2507.21836"},"observation_digest":"sha256:349dfc2a4b4e83b97e6d9bb62506d157b778c82d994143ced5df314d080ae94a","observation_id":"4c924188-6d0e-4605-9afb-89eb632f15d7","resolution":{"observed_at":"2026-08-06T12:23:55.175839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T12:09:26.376258Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22034","last_updated":"2025-07-29T17:34:12Z","snapshot_observed_at":"2026-08-07T20:29:47.386254Z","submitted_at":"2025-07-29T17:34:12Z","title":"UserBench: An Interactive Gym Environment for User-Centric Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:26.376258Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2507.22034"},"observation_digest":"sha256:aba3ea8aaf96dc100977ab9c45adb464769b346b81935136c753d6e92621c316","observation_id":"77514045-5d44-4f40-be4c-22d915a50560","resolution":{"observed_at":"2026-08-06T12:09:26.376258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T00:03:29.999533Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:29.999533Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:0aaa28096f512f453f757602ecbdca2df88ee388d160ced5ac75cc9b6eb711b7","observation_id":"7a0b5e96-f4a5-4364-a336-25872a9514fc","resolution":{"observed_at":"2026-08-06T00:03:29.999533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T23:57:33.485908Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13167","last_updated":"2025-08-06T17:01:02Z","snapshot_observed_at":"2026-08-05T23:57:29.481263Z","submitted_at":"2025-08-06T17:01:02Z","title":"Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:57:33.485908Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.13167"},"observation_digest":"sha256:9a8c0aefdf3c1d75a651b9dac84703a2e0a2ea4ae74dba4860ef0b32c561ff0d","observation_id":"0824de45-a673-4ba2-a2a3-3a113de407a4","resolution":{"observed_at":"2026-08-05T23:57:33.485908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T16:22:51.584383Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.584383Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:995b6457f708ee151afbdfd9c26e8d100f1350a0d83ee29ce11970c7af2e8977","observation_id":"a7d18c52-045b-4390-a996-eb97c0cad2ef","resolution":{"observed_at":"2026-08-05T16:22:51.584383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T16:17:16.817954Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18780","last_updated":"2025-08-26T08:04:04Z","snapshot_observed_at":"2026-08-09T01:31:13.767741Z","submitted_at":"2025-08-26T08:04:04Z","title":"Harnessing Rule-Based Reinforcement Learning for Enhanced Grammatical Error Correction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T16:17:16.817954Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.18780"},"observation_digest":"sha256:36f4e92656d30ec33439f85748f9eff556dbdcb7a2a1bc2a5a3d8e03b2197488","observation_id":"6a3e08fd-da83-46f4-8a76-dfd42cea623b","resolution":{"observed_at":"2026-08-05T16:17:16.817954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T15:44:14.848125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19598","last_updated":"2025-08-27T06:19:50Z","snapshot_observed_at":"2026-08-05T15:44:13.449330Z","submitted_at":"2025-08-27T06:19:50Z","title":"Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T15:44:14.848125Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.19598"},"observation_digest":"sha256:3a0486081bcd11ab7ebbfedbb1658840a262a250e962da8bdc7103bc32cd2e32","observation_id":"f5cc4b08-122f-4dbe-8bac-4bcd6feb5e3f","resolution":{"observed_at":"2026-08-05T15:44:14.848125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T14:57:39.427791Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-06T20:37:40.736850Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.427791Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:91324ff5eba0ba29d9405f2c42b099d1b673ce6c1dae3bdd457a7bec5fbfad8e","observation_id":"0b4a37c3-6a47-4f09-a775-3a90ffedb885","resolution":{"observed_at":"2026-08-05T14:57:39.427791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T11:39:22.953751Z","title":"ToRL : Scaling Tool-Integrated RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-07T15:24:21.164792Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.953751Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:414775970abbadb4a01b92da0d86fbd3eb6c771fa45cd0ec0447dfa2b719e539","observation_id":"aa12c784-d0c1-47d4-9e2a-41d1e08b1339","resolution":{"observed_at":"2026-08-05T11:39:22.953751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2509.02544","last_updated":"2025-09-05T14:59:27Z","snapshot_observed_at":"2026-08-05T09:41:26.544360Z","submitted_at":"2025-09-02T17:44:45Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T10:13:58.774968Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.02544"},"observation_digest":"sha256:0a9d155c8d3fa71b388a587dacf5b66515664212530bff41fe88f88733e03c1f","observation_id":"b9f49a87-c1ee-4848-adad-06a39be94915","resolution":{"observed_at":"2026-05-13T10:13:59.036699Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:f8a1d7dbabaae6a11e56156ec4ab86d43964f778b75538bffc6448f74d7b0cee","observation_id":"7d4cf452-a9e5-41dc-835e-67e5a5324a0f","resolution":{"observed_at":"2026-05-18T19:21:48.647828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T23:55:38.101554Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-08T11:28:39.967324Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.101554Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:bf90033ed0d65f9e1d39e301958cc6b6d91bfd213e27a03c118706d9ea64a4d8","observation_id":"e44d5100-5f37-478c-8a4d-474f38a0c806","resolution":{"observed_at":"2026-08-04T23:55:38.101554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:41d34e679564c60877d0e666841b969d3f16957d6ef7d1f705cd7df9e3224e75","observation_id":"70fe5237-d565-4d4d-8b25-e3e90c7d63e2","resolution":{"observed_at":"2026-05-18T00:02:24.780909Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T16:07:33.433285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.433285Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e4b397cfb6cbf6aa3179e74eff2c5655266f42e758be3b545128fe85d5fe9ad2","observation_id":"ac6d0e7b-4034-494d-b8cf-bf0226db0283","resolution":{"observed_at":"2026-08-04T16:07:33.433285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2509.18847","last_updated":"2026-04-15T06:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-23T09:35:49Z","title":"Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T15:00:51.162221Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.18847"},"observation_digest":"sha256:6270b343114f145861dd98e1f3fa1935e7b1192640faba5caaefe85712864f3f","observation_id":"4017163c-30ac-4cba-9d59-a1bcd7e95c4e","resolution":{"observed_at":"2026-05-18T15:01:31.394429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2510.22977","last_updated":"2026-04-17T17:15:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-27T03:58:29Z","title":"The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T04:09:50.183494Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2510.22977"},"observation_digest":"sha256:46a70ed186234efcc580b15ef4644b5dfe4146a3d4fd8cdc9ba2b70ebd2e2f8d","observation_id":"f3054fae-3073-4eae-82ed-0095c656cfff","resolution":{"observed_at":"2026-05-18T04:10:51.356802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T06:40:24.762093Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10739","last_updated":"2026-08-03T08:17:50Z","snapshot_observed_at":"2026-08-07T08:51:03.458621Z","submitted_at":"2025-12-11T15:26:28Z","title":"Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T06:40:24.762093Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2512.10739"},"observation_digest":"sha256:0827994082ed44f40f0f17fdbe45a892568d37caf339c201ff189b8d537b8809","observation_id":"d543d618-6245-4541-a094-87a016794b19","resolution":{"observed_at":"2026-08-04T06:40:24.762093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-03T03:04:43.934885Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025e","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.934885Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:e4e874e1c41fbc254b858c895ca5f68048675bd4d49a02bf93895c912e20537b","observation_id":"e8fec37e-6cc5-425d-950a-b976230eb3af","resolution":{"observed_at":"2026-08-03T03:04:43.934885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2603.16876","last_updated":"2026-05-08T08:14:14Z","snapshot_observed_at":"2026-08-08T17:32:30.075016Z","submitted_at":"2026-02-17T12:48:32Z","title":"Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T21:51:10.972744Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2603.16876"},"observation_digest":"sha256:3d754f7024ff9936ca6c4dfe590cc6114d3ef7338439a51e8e8b8064f9a8c196","observation_id":"4fb04403-fcde-49e9-9366-19131b72d040","resolution":{"observed_at":"2026-05-15T21:51:40.765848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.02794","last_updated":"2026-04-03T07:02:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T07:02:13Z","title":"CharTool: Tool-Integrated Visual Reasoning for Chart Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T20:07:23.153064Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.02794"},"observation_digest":"sha256:ff034f06a32a683bdcefd40e529eee16356ecf7dec0afe53a03cd9470a022823","observation_id":"8ef8c2e9-57e1-49e3-8c4c-3e37788322b3","resolution":{"observed_at":"2026-05-13T20:08:12.750849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:1006d65d51acd6d3cf714ac1daad10f29f233149f6f52cf83f53e6265a5562be","observation_id":"706f8afb-266d-4440-9298-f4ad4fa4182c","resolution":{"observed_at":"2026-05-11T00:10:51.855593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.09455","last_updated":"2026-04-10T16:14:48Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:14:48Z","title":"E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T18:08:18.056525Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.09455"},"observation_digest":"sha256:0a7daf91a7804132622da4ab49c20556477bc4c8a327497116b2f1167bc40922","observation_id":"218d5a03-420e-463c-9b2f-0f0cf5ad4642","resolution":{"observed_at":"2026-05-11T05:25:59.826281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:00.503836Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.18292"},"observation_digest":"sha256:ff0091fe50996fe7a7305fa7dc712738ac020e20c2d886e64a135967eab325d4","observation_id":"187e6633-ab0d-4b30-9cb5-7edc87a06037","resolution":{"observed_at":"2026-05-10T05:25:54.216722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.00737","last_updated":"2026-08-06T13:58:03Z","snapshot_observed_at":"2026-08-09T03:11:27.917581Z","submitted_at":"2026-05-01T15:38:13Z","title":"To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T19:32:57.054584Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.00737"},"observation_digest":"sha256:0722a47ef6cc8359c946e3b019073aaa18bf2c00125d123b35bdaf2ecaff9572","observation_id":"bcc06785-14f6-4835-beb0-663c880a8336","resolution":{"observed_at":"2026-05-11T15:36:10.366674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-08T05:34:18.754195Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:3f2d473479ca4b5c05e941844ac4b711171c92a7a667f3fa9869c76c7ae94dc9","observation_id":"2001a2f7-cab5-4e06-993e-153caaf1c8bb","resolution":{"observed_at":"2026-05-11T03:30:58.761107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T05:20:45.032153Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-08T05:34:18.754195Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T05:20:45.032153Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:3ab26841753eb5d735ebb13f874186d74bd0cf0931e4daa3b384acefcaf4da22","observation_id":"7a1abce0-7186-407a-84da-7f16f046f19a","resolution":{"observed_at":"2026-08-04T05:20:45.032153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.09931","last_updated":"2026-05-11T03:28:43Z","snapshot_observed_at":"2026-08-03T02:44:35.388736Z","submitted_at":"2026-05-11T03:28:43Z","title":"PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:49.165066Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.09931"},"observation_digest":"sha256:f82ff9b7a6b306f8d62e94bbf5aff86fb4bea63590f8db1f8a3b314d9530b598","observation_id":"8d5585b9-95a3-409d-81b0-3bb2dd92a7b2","resolution":{"observed_at":"2026-05-12T06:01:23.221704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.10787","last_updated":"2026-05-20T01:39:17Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:20:51Z","title":"ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:47.496496Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.10787"},"observation_digest":"sha256:86362e126a045384cbcab6b5b4c46e3bde5cec1c7f4f69d80208af9f5da2f256","observation_id":"fa50e7bb-92cb-4f0a-9e52-486162a28127","resolution":{"observed_at":"2026-05-12T06:01:23.444039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.10787","last_updated":"2026-05-20T01:39:17Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:20:51Z","title":"ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-21T08:08:04.544564Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.10787"},"observation_digest":"sha256:595adc6d847437687e290c7f754d5db2bb7555e04771e9e494bd569a198a83db","observation_id":"e38e9970-45c9-415f-8c2f-b14b8d94550d","resolution":{"observed_at":"2026-05-21T08:09:51.260787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.17734","last_updated":"2026-05-18T01:35:11Z","snapshot_observed_at":"2026-07-06T23:28:41.111402Z","submitted_at":"2026-05-18T01:35:11Z","title":"Harnessing LLM Agents with Skill Programs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T11:26:19.382463Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.17734"},"observation_digest":"sha256:6d5565f236b369796c05438af2477f91332294f29ae180273efa2de525b4e8f1","observation_id":"160a545c-9bd6-4ab7-ba7d-e17491a1ca7a","resolution":{"observed_at":"2026-05-20T11:28:14.372406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.27788","last_updated":"2026-05-27T00:11:31Z","snapshot_observed_at":"2026-08-02T05:35:24.628664Z","submitted_at":"2026-05-27T00:11:31Z","title":"Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:58.677299Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.27788"},"observation_digest":"sha256:0237be8b6744a0569bc86b4d809c8bc3c3a44effd0a39711d09f3187767d9ed1","observation_id":"d07a6f08-b72c-426f-944b-2693cdfc2f61","resolution":{"observed_at":"2026-06-29T13:53:28.597051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.28774","last_updated":"2026-05-27T17:36:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:36:39Z","title":"Agent Explorative Policy Optimization for Multimodal Agentic Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T12:22:39.655615Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.28774"},"observation_digest":"sha256:9679eae18790ec9b9e391826a7f2ba0ca7010e26606e1ee9998dbd1e051fb7f2","observation_id":"0cd270cd-f03b-4a05-b28a-9734d0724f15","resolution":{"observed_at":"2026-06-29T12:23:24.097141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.28774","last_updated":"2026-05-27T17:36:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:36:39Z","title":"Agent Explorative Policy Optimization for Multimodal Agentic Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T12:22:39.655615Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.28774"},"observation_digest":"sha256:cdfc0bd6006618ad861710a1bc0476a2e930e7dc76585ffdba03ed8cd5a603de","observation_id":"c528edd2-8f50-4d0b-aee0-6209ce4db83c","resolution":{"observed_at":"2026-06-29T12:23:23.709428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.03762","last_updated":"2026-06-02T15:16:12Z","snapshot_observed_at":"2026-08-02T17:38:14.832178Z","submitted_at":"2026-06-02T15:16:12Z","title":"Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T11:19:31.702516Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.03762"},"observation_digest":"sha256:c7ce1cffa18710ef4765397a2f8a8598eb45990e52763a209ff848b6f301e2ff","observation_id":"89728c42-fa89-46bf-94cc-d12ce2f5c9bb","resolution":{"observed_at":"2026-07-02T02:06:26.298738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.07074","last_updated":"2026-06-05T09:10:50Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:10:50Z","title":"SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T22:54:44.329613Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.07074"},"observation_digest":"sha256:fda2d1d75985931f08ae03b453933b803a63b12ffc72f049c8e76166b3547c56","observation_id":"3385bd01-37da-4c78-8fe7-45aac4978f0c","resolution":{"observed_at":"2026-07-02T16:17:08.740016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.09371","last_updated":"2026-06-08T11:48:55Z","snapshot_observed_at":"2026-08-06T09:58:48.976204Z","submitted_at":"2026-06-08T11:48:55Z","title":"Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T16:43:00.259139Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.09371"},"observation_digest":"sha256:3ae9fffe8b2587dc3f13b6ded2ee4ba75b742a353cf00223f57213fcd7557a6d","observation_id":"527b852c-249b-406e-bffd-26a8d7b36d08","resolution":{"observed_at":"2026-07-03T01:17:30.699154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.10875","last_updated":"2026-06-09T13:51:32Z","snapshot_observed_at":"2026-08-05T02:50:02.993079Z","submitted_at":"2026-06-09T13:51:32Z","title":"Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:23:42.745788Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.10875"},"observation_digest":"sha256:b92918d7f82f62cb098b3427ff4c56e7d83f5257fd0d66044a82a850879dddc3","observation_id":"8813d5a7-129f-4fa4-8f6f-300c3a5cb865","resolution":{"observed_at":"2026-07-03T05:07:39.261630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.11652","last_updated":"2026-06-10T04:30:37Z","snapshot_observed_at":"2026-08-07T14:14:25.800605Z","submitted_at":"2026-06-10T04:30:37Z","title":"IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T10:57:55.875707Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.11652"},"observation_digest":"sha256:1647910ca7e2e7a28fe92b9e2c1164471c26c46a7dedb7444e00ecdf43975b13","observation_id":"89052348-3a9c-4647-871f-62b814bbd5d7","resolution":{"observed_at":"2026-07-03T08:17:45.064660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T10:21:55.485624Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:19ff6b775874fecf54c5e3019fb7f3feb390c2fa984c7d619216bb15d07fb671","observation_id":"8a2e1419-c0c5-4db1-9992-b40160bc9eb4","resolution":{"observed_at":"2026-07-03T09:37:49.403443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-03T02:12:28.554279Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:28.554279Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:02cacc1c03a04379660505cda464b49e522e19d39d580539858fd4ee821d6297","observation_id":"73e0d108-c07f-4b76-95e9-cbeb0f34d7fa","resolution":{"observed_at":"2026-08-03T02:12:28.554279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.12908","last_updated":"2026-06-11T05:06:50Z","snapshot_observed_at":"2026-08-05T04:59:46.668803Z","submitted_at":"2026-06-11T05:06:50Z","title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T06:49:12.070481Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.12908"},"observation_digest":"sha256:a91f110ee87c61dace71142b8b1f9a9db09311e2b182ff6ac0304c5a83aeec29","observation_id":"f3056329-2a84-46e7-a6ac-8d65e3d85169","resolution":{"observed_at":"2026-07-03T14:58:33.209084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:68d3933e375c39ec3160f273f3c91a31f7e3b59331a011c88b9fe27c75a86eab","observation_id":"206a8438-71f8-4e3a-8575-8313c113c327","resolution":{"observed_at":"2026-07-04T08:09:40.636889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.26027","last_updated":"2026-06-24T16:55:56Z","snapshot_observed_at":"2026-08-05T06:50:33.242401Z","submitted_at":"2026-06-24T16:55:56Z","title":"Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T19:28:36.499352Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.26027"},"observation_digest":"sha256:2b70d450e3e361b70edb4c9ad5ec89e93efcd967898bbb884d6051760d381e98","observation_id":"23264379-35df-4bd4-bf00-2e6d31f696a2","resolution":{"observed_at":"2026-07-04T20:50:12.369980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:54.960194Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:f9e23084ac62fbb29f3083cecbd44ca3faf617ba3513a6a72cb75e7b0acddb7b","observation_id":"baa37537-78f8-422b-b35c-ec386e6386c2","resolution":{"observed_at":"2026-07-01T09:45:40.244054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-07-13T07:12:34.663753Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T07:12:34.663753Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:b0e786f97cea864a2bbc09eb3d88a638e5362de10ec904e7387a54002278f28f","observation_id":"6ebedfcc-fc11-4d90-97d7-91509a9fdb01","resolution":{"observed_at":"2026-07-13T07:12:34.663753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-02T09:17:12.937563Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:12.937563Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:d60225291f69a94e8b5fcdcad020d6879d3aa3ac202c57317959124109653fc3","observation_id":"e3b45eb5-c77a-4597-bb91-d81577474950","resolution":{"observed_at":"2026-08-02T09:17:12.937563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-03T02:05:44.909805Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T02:05:44.909805Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:90109fa91d92f01f254b63fcd89a7d7c53b594ce4ccfde5c6fa1b64a14fc02f4","observation_id":"85bdd02c-b90a-4538-b798-a0eae5c34095","resolution":{"observed_at":"2026-08-03T02:05:44.909805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T04:36:25.292766Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T04:36:25.292766Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:9a10687fdbcf0343641db34a569b58a70e8c88f5a95f665987f4d102a5dda462","observation_id":"bcee6077-162f-49d4-b9ec-4b8b61e6d5cd","resolution":{"observed_at":"2026-08-04T04:36:25.292766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2607.01084","last_updated":"2026-07-01T15:40:25Z","snapshot_observed_at":"2026-08-07T08:23:08.883776Z","submitted_at":"2026-07-01T15:40:25Z","title":"Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-02T12:16:47.299349Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.01084"},"observation_digest":"sha256:ebf18f236abac181663f43310a8234ad5afcf3fce285b3a97f363fe9aeb26381","observation_id":"cbe8b569-abbf-4213-be6e-ee19d8d30bbf","resolution":{"observed_at":"2026-07-02T12:16:56.326575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:069733d3ed8108675968cb9a6d0c9612765cda7a194f5ed8f115643a534e5fd4","observation_id":"b57a85d3-e8bc-44e0-b596-f4f14bc7aa84","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-07T20:40:56.219597Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:460375a8c56b9f6544dc413566c47d395a6bf82a55192dbb25036b95f67e303b","observation_id":"bc658aa5-335e-456c-bbc8-569f751eb622","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-01T22:12:53.833936Z","title":"org/abs/2503.23383","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15845","last_updated":"2026-07-27T13:53:28Z","snapshot_observed_at":"2026-08-07T14:55:46.129479Z","submitted_at":"2026-07-17T11:03:01Z","title":"Knowledge-Centric Agents for Workflow Generation in ComfyUI","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T22:12:53.833936Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.15845"},"observation_digest":"sha256:ed2e86c52835e5f35358209445d8b505ee3f9d5679f486f8854d7706e32c0aac","observation_id":"012ef096-fe13-4c84-b804-db4c759c726e","resolution":{"observed_at":"2026-08-01T22:12:53.833936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-01T13:52:49.091047Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.091047Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:bfc4164aa6ac9d581f5d0b50167941f57eda9ff25dec1c6e0dd8f52d3d015f34","observation_id":"e8d2fc97-d1e1-45c2-985b-edf2ec06025b","resolution":{"observed_at":"2026-08-01T13:52:49.091047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-01T22:56:53.271564Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22688","last_updated":"2026-07-17T02:39:57Z","snapshot_observed_at":"2026-08-07T21:59:25.588421Z","submitted_at":"2026-07-17T02:39:57Z","title":"Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T22:56:53.271564Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.22688"},"observation_digest":"sha256:38f15c4e41c086449b5b32d1fb2eaa40af06ed6be95a9f896be98713ccc54bb1","observation_id":"f134a709-de0c-4f9d-9fbf-e0f22b86e1b4","resolution":{"observed_at":"2026-08-01T22:56:53.271564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T23:23:14.645199Z","title":"10 Xuefeng Li, Haoyang Zou, and Pengfei Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-07T12:28:19.531850Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.645199Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:60fb1e7064837d55574518dc3bbebd087655e69a9c589ed487ceb6177f9ece5e","observation_id":"8b721a9c-415e-4ccb-a10e-af5f6890dec9","resolution":{"observed_at":"2026-08-04T23:23:14.645199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T23:05:27.937398Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01678","last_updated":"2026-08-03T04:14:59Z","snapshot_observed_at":"2026-08-07T11:35:10.108951Z","submitted_at":"2026-08-03T04:14:59Z","title":"Progressive Agent Skill Generation via Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T23:05:27.937398Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.01678"},"observation_digest":"sha256:ac8e10c7fe3c2bd569e12a65f227e66653f7c12051f59f3afe60322049f1933e","observation_id":"05877cd5-5ffe-4f1a-9b12-286a45b46ca7","resolution":{"observed_at":"2026-08-04T23:05:27.937398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T21:49:39.554840Z","title":"Nebius AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05886","last_updated":"2026-08-06T11:07:42Z","snapshot_observed_at":"2026-08-09T03:11:08.749658Z","submitted_at":"2026-08-06T11:07:42Z","title":"CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:49:39.554840Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.05886"},"observation_digest":"sha256:43794150913cadf46609ac50a46e0eb2dcfef6d56eab6d259a697b33855404a7","observation_id":"927b7980-bf7f-4d01-b64b-5900562bc05e","resolution":{"observed_at":"2026-08-07T21:49:39.554840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:27:44.357730Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06128","last_updated":"2026-08-06T15:01:29Z","snapshot_observed_at":"2026-08-09T03:12:08.878129Z","submitted_at":"2026-08-06T15:01:29Z","title":"Contextual Information Policy Optimization for Search Agents","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T14:27:44.357730Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.06128"},"observation_digest":"sha256:dc6fb1063e27056db643639a783697ca3f69ce85e096ebd281edb214f7f8ea3a","observation_id":"ffc6c40f-2636-40c7-a5d1-2b2f38aca1c8","resolution":{"observed_at":"2026-08-07T14:27:44.357730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.23383/citation-record","integrity":"/paper/2503.23383/integrity","json":"/paper/2503.23383/citation-record.json","paper":"/paper/2503.23383"},"outbound":[],"paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 77 inbound Pith citation observations for arXiv:2503.23383."}