{"as_of":"2026-08-21T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:612908cb338be97870051690505ec62307f0afc415228554089d4d04ed965fb5","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:39:25.500635Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:54:44.263730Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:55.500268Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2509.07969"},"observation_digest":"sha256:9ecacb70f26be6e7fcb94f377560d8a5b03f759b1310357f16f3980578844624","observation_id":"3b1a0ca3-49ad-4662-8895-f46c2393af3f","resolution":{"observed_at":"2026-05-18T01:17:55.589474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2512.08980","last_updated":"2026-04-03T08:53:56Z","snapshot_observed_at":"2026-08-19T23:51:56.185172Z","submitted_at":"2025-12-05T10:02:38Z","title":"Training Multi-Image Vision Agents via End2End Reinforcement Learning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T00:59:28.618477Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2512.08980"},"observation_digest":"sha256:504eb586da7c475262a9620212d51fbd41af7458636a13a186d3365be384f44b","observation_id":"96af294e-368c-48d0-903a-3429d47b5ec8","resolution":{"observed_at":"2026-05-17T01:01:24.304910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2601.03555","last_updated":"2026-06-29T12:43:12Z","snapshot_observed_at":"2026-08-19T16:01:31.681314Z","submitted_at":"2026-01-07T03:49:48Z","title":"SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T17:21:54.516597Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2601.03555"},"observation_digest":"sha256:54726ade1386a32baf5673fb67bb7cbbf27a782c740f78dea5f77d4454da4d5c","observation_id":"a612c8e4-589d-4e9a-8735-08555f0ef9db","resolution":{"observed_at":"2026-05-16T17:23:09.869455Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-03T12:18:10.591575Z","title":"InThe 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03555","last_updated":"2026-06-29T12:43:12Z","snapshot_observed_at":"2026-08-19T16:01:31.681314Z","submitted_at":"2026-01-07T03:49:48Z","title":"SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:18:10.591575Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2601.03555"},"observation_digest":"sha256:1054a2bb73243d353fb11203475018d81721d632d6ddcf98f5986ddacfe93392","observation_id":"fe72e3d9-1493-4d5e-92f7-5cd4f18923dd","resolution":{"observed_at":"2026-08-03T12:18:10.591575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2601.06943","last_updated":"2026-05-18T06:58:21Z","snapshot_observed_at":"2026-08-15T22:39:05.824128Z","submitted_at":"2026-01-11T15:07:37Z","title":"Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T16:35:24.557809Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2601.06943"},"observation_digest":"sha256:c165975f0a14ac28a2b4718f195daed92493344f9ffa7cb20166441a328e26f4","observation_id":"ccd8f0f6-98b2-4483-af25-c7093a70a153","resolution":{"observed_at":"2026-05-21T16:40:22.776109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2601.21468","last_updated":"2026-05-18T07:50:29Z","snapshot_observed_at":"2026-08-04T01:48:38.560710Z","submitted_at":"2026-01-29T09:47:17Z","title":"MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T15:15:22.055616Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2601.21468"},"observation_digest":"sha256:078c9b5eca6e9d2db37e8655aab2e76460d0b757fe9186cc2db126211954eb2a","observation_id":"7b0580b7-7b2e-4ae4-be77-75e1a5414e09","resolution":{"observed_at":"2026-05-21T15:20:17.554708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-13T10:27:03.396626Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:5f4e0f89460de7e512dd9952deede29cc21488b37fc31e80fd079ce393e7f423","observation_id":"91ff23a9-3d9f-4891-9a74-03c8c64502b9","resolution":{"observed_at":"2026-05-11T00:45:50.171881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2604.07900","last_updated":"2026-04-09T07:17:00Z","snapshot_observed_at":"2026-08-11T16:03:38.765421Z","submitted_at":"2026-04-09T07:17:00Z","title":"AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T18:32:31.955785Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2604.07900"},"observation_digest":"sha256:85e9d074424bdd9c03efb7c234cf702312727d8cc0bdf1274affeb805a8a47af","observation_id":"f1517022-504c-424c-bc17-2bc433818364","resolution":{"observed_at":"2026-05-10T18:35:42.804115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-08-12T14:51:38.278220Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:9eb2f2e526176a2487c4b4d7a08d6662d28d85b3c2e350bad4a545b70e3df8fc","observation_id":"560baf11-4602-4904-9981-a6ab9380935c","resolution":{"observed_at":"2026-05-11T00:10:51.983542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2604.09455","last_updated":"2026-04-10T16:14:48Z","snapshot_observed_at":"2026-08-10T22:45:27.818684Z","submitted_at":"2026-04-10T16:14:48Z","title":"E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T18:08:18.056525Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2604.09455"},"observation_digest":"sha256:86c0cb005af58109130542f13c29dd3a15b30c275905a873e5b84b43a781ace0","observation_id":"a69f55b3-9496-44f2-b475-685ca459cb6a","resolution":{"observed_at":"2026-05-11T05:25:59.842752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.02178","last_updated":"2026-05-04T03:15:56Z","snapshot_observed_at":"2026-08-12T12:40:32.507029Z","submitted_at":"2026-05-04T03:15:56Z","title":"T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T19:36:00.359351Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.02178"},"observation_digest":"sha256:05dfa6580657e9625ebd9d54244ad5381a789178c503bbf54fdbb9df7fbdba99","observation_id":"6ddc7489-e2cc-4559-827b-17057b6bd84f","resolution":{"observed_at":"2026-05-09T05:45:22.194748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.06326","last_updated":"2026-05-07T14:23:21Z","snapshot_observed_at":"2026-08-18T14:16:46.615272Z","submitted_at":"2026-05-07T14:23:21Z","title":"Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T10:30:36.330305Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.06326"},"observation_digest":"sha256:73099842770eb274bfa068b7f7f76190c54a94d02cd93be8d9fe681661081249","observation_id":"ac9ea6eb-31f3-4f26-b14a-8460bc5b76b7","resolution":{"observed_at":"2026-05-11T20:01:10.534979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.07331","last_updated":"2026-05-08T06:35:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T06:35:02Z","title":"Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-11T01:19:58.448344Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.07331"},"observation_digest":"sha256:651493d0af98d01cd6d829012ffb62f9c0971b8b122b2a127e031f3da96c4754","observation_id":"f30c080e-4697-4ce1-bf3d-af7bb0848535","resolution":{"observed_at":"2026-05-11T04:30:55.365079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-18T09:21:07Z","snapshot_observed_at":"2026-08-21T16:09:31.590082Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:63e72419897498e29c1ba55e5980d3d4405f98e40cd7c2787571a3eee1ed5b10","observation_id":"31f4b51b-df37-4077-ba13-c1f579eaefd2","resolution":{"observed_at":"2026-05-11T03:30:58.767379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-04T05:20:45.024277Z","title":"Simpletir: End-to-end reinforcement learning for multi-turn tool-integrated reasoning.arXiv preprint arXiv:2509.02479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-18T09:21:07Z","snapshot_observed_at":"2026-08-21T16:09:31.590082Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:20:45.024277Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:a9324e6eb4f98177504ca3767152df975c0cb558e5339350d624682a9031a5ef","observation_id":"2bc2a4a6-fece-4205-bff3-57e46fc074bc","resolution":{"observed_at":"2026-08-04T05:20:45.024277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.08666","last_updated":"2026-05-09T04:07:20Z","snapshot_observed_at":"2026-08-15T07:42:31.353423Z","submitted_at":"2026-05-09T04:07:20Z","title":"The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:24:03.186413Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.08666"},"observation_digest":"sha256:1cfb84433ad819fbf9c3aec70fe854d5e4c2dfca710752ffc8f4c1ba6b6a3689","observation_id":"f2561b43-d11b-4d1f-9b53-3dcd18f5c7c6","resolution":{"observed_at":"2026-05-12T08:01:28.831917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.09544","last_updated":"2026-05-10T13:56:46Z","snapshot_observed_at":"2026-08-15T07:52:57.707878Z","submitted_at":"2026-05-10T13:56:46Z","title":"TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T02:47:31.830410Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.09544"},"observation_digest":"sha256:ede6f5db8e4b27de9253cc113361fc42ecfccd77e854e3bc1786fde28b170837","observation_id":"7a237f99-e4d5-46ed-ab9a-7f6ec9deeed2","resolution":{"observed_at":"2026-05-12T02:51:18.092249Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.09931","last_updated":"2026-05-11T03:28:43Z","snapshot_observed_at":"2026-08-11T15:16:38.795718Z","submitted_at":"2026-05-11T03:28:43Z","title":"PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:49.165066Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.09931"},"observation_digest":"sha256:ea3e4bdc44eb383f95f14f9c395d995edff36d35d5c8fe1f63920f1410015193","observation_id":"deb6548f-7b70-4c7d-94d1-dba84e7c51ce","resolution":{"observed_at":"2026-05-12T06:01:23.336361Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.10754","last_updated":"2026-05-11T15:53:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T15:53:54Z","title":"The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T05:03:58.419364Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.10754"},"observation_digest":"sha256:deb0b64eb4a201f9fa3244e0b0f5521005e7433a056448336afd67e36372dd14","observation_id":"8ac226f4-f045-465f-9c53-00abf4f637b6","resolution":{"observed_at":"2026-05-12T05:41:25.931625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.17734","last_updated":"2026-05-18T01:35:11Z","snapshot_observed_at":"2026-08-15T22:51:21.376216Z","submitted_at":"2026-05-18T01:35:11Z","title":"Harnessing LLM Agents with Skill Programs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T11:26:19.382463Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.17734"},"observation_digest":"sha256:1a9e380ce32d891f67dcf03142653d1594ccb84a887a1b99ef206dbc31f28a01","observation_id":"cb0d95a3-6838-485d-8318-373958214abb","resolution":{"observed_at":"2026-05-20T11:28:14.399273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.22138","last_updated":"2026-05-21T08:11:54Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:11:54Z","title":"Efficient Agentic Reasoning Through Self-Regulated Simulative Planning","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-22T06:33:36.846345Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.22138"},"observation_digest":"sha256:c1a5d3d1f1d4f4b7e24fc6d19084fb9eb43d6bd22f22fef883de42010d0e5ad9","observation_id":"9d65937d-eaaa-40ce-970b-180b2e575a03","resolution":{"observed_at":"2026-05-22T06:34:40.940904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2605.28751","last_updated":"2026-05-27T17:09:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-27T17:09:30Z","title":"Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-29T14:41:13.191919Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2605.28751"},"observation_digest":"sha256:9c224c35ccdeba8eedd03ff87b75861bf72fad3f3d0d5c20c9ef0e40c1a75012","observation_id":"940e9d91-fd9b-43b7-853c-a6c43e595780","resolution":{"observed_at":"2026-06-29T14:43:30.596549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2606.02132","last_updated":"2026-06-02T07:53:40Z","snapshot_observed_at":"2026-08-14T07:55:39.646678Z","submitted_at":"2026-06-01T11:58:55Z","title":"Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T14:59:57.983338Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2606.02132"},"observation_digest":"sha256:5a5e5e1d66e4dbc1e19c88f5f200b21fd229ffaeae799db2dd9c33c4d0d062c1","observation_id":"b717725a-31f2-495d-82de-d44406034bd6","resolution":{"observed_at":"2026-07-01T22:46:20.272365Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2606.03382","last_updated":"2026-06-04T22:09:00Z","snapshot_observed_at":"2026-08-02T02:33:38.414458Z","submitted_at":"2026-06-02T09:26:26Z","title":"Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T10:51:30.546134Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2606.03382"},"observation_digest":"sha256:57190463ea517934c3817fcccdfc87c1773e128fb28a90de5e62cfafb8322313","observation_id":"db400056-07f6-443a-8d66-87109d368a53","resolution":{"observed_at":"2026-07-02T02:36:26.618510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2606.10875","last_updated":"2026-06-09T13:51:32Z","snapshot_observed_at":"2026-08-16T06:14:45.909453Z","submitted_at":"2026-06-09T13:51:32Z","title":"Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T13:23:42.745788Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2606.10875"},"observation_digest":"sha256:5ef32750a6a01355021aadaa65eda6777b2c6ff4120387628966550b5d5e1c19","observation_id":"ee508e64-b31f-46f0-a3e3-2603a54f33af","resolution":{"observed_at":"2026-07-03T05:07:39.263609Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2606.23678","last_updated":"2026-06-22T17:58:54Z","snapshot_observed_at":"2026-08-07T05:35:38.415603Z","submitted_at":"2026-06-22T17:58:54Z","title":"AIR: Adaptive Interleaved Reasoning with Code in MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T09:06:38.001604Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2606.23678"},"observation_digest":"sha256:1b27177a91f709171cc83beba5957b6afb16805ad50b9cca3d93ec124f0e2baa","observation_id":"3489bb9e-b3f5-41e4-bbad-1e1de868f8f4","resolution":{"observed_at":"2026-07-04T10:09:45.008651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2606.24233","last_updated":"2026-06-23T07:22:22Z","snapshot_observed_at":"2026-08-14T03:48:01.087852Z","submitted_at":"2026-06-23T07:22:22Z","title":"Latent Visual States for Efficient Multimodal Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T00:38:11.619574Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2606.24233"},"observation_digest":"sha256:86cd54f880253b4ba3356fc9e5c02ce50d58045cad4d1c634fb2a4f969db057b","observation_id":"fb20a44c-432a-4c90-98ee-f3ee07a3d67d","resolution":{"observed_at":"2026-07-04T16:29:57.215761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2606.26027","last_updated":"2026-06-24T16:55:56Z","snapshot_observed_at":"2026-08-10T18:28:15.087649Z","submitted_at":"2026-06-24T16:55:56Z","title":"Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T19:28:36.499352Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2606.26027"},"observation_digest":"sha256:853eacd1c576e4275cc3d028b509f04617c439777c3dcd412c5ec9a2b2590bff","observation_id":"46ee27e6-2fc5-4a18-9928-240853ad722b","resolution":{"observed_at":"2026-07-04T20:50:12.363329Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2607.07050","last_updated":"2026-08-02T05:11:29Z","snapshot_observed_at":"2026-08-15T00:39:19.550863Z","submitted_at":"2026-07-08T06:26:13Z","title":"When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T21:05:08.742517Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2607.07050"},"observation_digest":"sha256:b2fcf2fb275906fd325ff18e47d76ddf5daeae4b7b0c977cc8d9c97c2d84e4b1","observation_id":"aaa91678-462f-4546-be5c-1b43ee95d308","resolution":{"observed_at":"2026-07-09T21:06:34.844654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-02T08:11:32.658488Z","title":"Sim- pleTIR: End-to-end reinforcement learning for multi-turn tool-integrated reasoning.arXiv preprint arXiv:2509.02479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07050","last_updated":"2026-08-02T05:11:29Z","snapshot_observed_at":"2026-08-15T00:39:19.550863Z","submitted_at":"2026-07-08T06:26:13Z","title":"When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T08:11:32.658488Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2607.07050"},"observation_digest":"sha256:a2cd06aaa814273c03397b9c78f6efa040699ada6bc2ba2ed8365ebd9ce07365","observation_id":"94fd6642-92ba-4341-9089-0f5ea2b83c00","resolution":{"observed_at":"2026-08-02T08:11:32.658488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-04T04:31:28.548139Z","title":"Sim- pleTIR: End-to-end reinforcement learning for multi-turn tool-integrated reasoning.arXiv preprint arXiv:2509.02479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07050","last_updated":"2026-08-02T05:11:29Z","snapshot_observed_at":"2026-08-15T00:39:19.550863Z","submitted_at":"2026-07-08T06:26:13Z","title":"When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T04:31:28.548139Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2607.07050"},"observation_digest":"sha256:e73860f7ebd4f3f6b5bff970c50c09f0da80a953fb89b75c01d41cb2eacc6db9","observation_id":"d27f17f7-783b-4aa4-aa49-d12de1ce277a","resolution":{"observed_at":"2026-08-04T04:31:28.548139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-02T06:36:47.880415Z","title":"Simpletir: End-to-end reinforcement learning for multi-turn tool-integrated reasoning.arXiv preprint arXiv:2509.02479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14145","last_updated":"2026-07-14T06:03:39Z","snapshot_observed_at":"2026-08-15T21:28:03.300154Z","submitted_at":"2026-07-14T06:03:39Z","title":"ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:47.880415Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2607.14145"},"observation_digest":"sha256:636a5e66f5555e78740c503c66108f91f0be672885c52876459cb5d0aea0e325","observation_id":"513c8760-7796-4bf8-8b78-cc2040292517","resolution":{"observed_at":"2026-08-02T06:36:47.880415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-02T14:50:17.781800Z","title":"Simpletir: End-to-end reinforcement learning for multi-turn tool-integrated reasoning.arXiv preprint arXiv:2509.02479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-19T19:36:19.217904Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:17.781800Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:cd3e4beddebf26153109730ed2784f772cf649502b083a3ba58b4e85005e0de4","observation_id":"62823d65-5a71-4f60-9b0f-88342c65e2d2","resolution":{"observed_at":"2026-08-02T14:50:17.781800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-04T21:54:44.263730Z","title":"arXiv preprint arXiv:2509.02479 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-17T07:40:14.829184Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.263730Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:5fd79e8485066f3741e61195112338bcd2aca827e5c20af7fe86d3ef2670787f","observation_id":"0b978fe9-44cc-42d7-996e-074b439cce26","resolution":{"observed_at":"2026-08-04T21:54:44.263730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02479/citation-record","integrity":"/paper/2509.02479/integrity","json":"/paper/2509.02479/citation-record.json","paper":"/paper/2509.02479"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24480","last_updated":"2025-05-30T11:30:18Z","snapshot_observed_at":"2026-08-16T19:00:49.578371Z","submitted_at":"2025-05-30T11:30:18Z","title":"Towards Effective Code-Integrated Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24480","snapshot_observed_at":"2026-08-05T11:39:21.563335Z","title":"Towards Effective Code-Integrated Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:21.563335Z"},"links":{"cited_paper":"/paper/2505.24480","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:36b64f556c5005266fe16c4efbe63d7e5f196da377d11ba3c000012c3bb759b3","observation_id":"b5aff72c-2ec4-4548-be35-d4ad6a0273f8","resolution":{"observed_at":"2026-08-05T11:39:21.563335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:27.537434Z","title":"Multi-Turn RL Training for CUDA Kernel Generation","venue":null,"work_id":"e7ce7aa8-05a8-4c95-8bd1-a32155f0d632","year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:21.654132Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:e59525728e9ecaad99d8222b367768a6ffa60fce081ce5f9b51e5c09a555cc1c","observation_id":"a67d6f6b-1a0a-446e-89b8-17b1e5b55bcf","resolution":{"observed_at":"2026-08-05T11:39:27.606728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T11:39:21.804526Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:21.804526Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:37ced916322b3399efbc36d29c56c98f245754285268dc7782790cf92104b580","observation_id":"59660ec3-2511-4b83-9db5-747d7c676b81","resolution":{"observed_at":"2026-08-05T11:39:21.804526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T11:39:21.969591Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:21.969591Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:c61a653cdf0a946fb48d262e9d320044c3701328c9ab5ca87fb0a89692add3d2","observation_id":"566ac665-b736-4d69-bee2-e56aa708acc7","resolution":{"observed_at":"2026-08-05T11:39:21.969591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T11:39:22.034107Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.034107Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:8021a493cf1895d31140470b0dc2d3faff933025ae3b9df42bfb9e6dc8049a7b","observation_id":"99fb6fa1-2182-4737-b173-c0a7fc7bb149","resolution":{"observed_at":"2026-08-05T11:39:22.034107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-08-14T09:16:00.399049Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-05T11:39:22.139956Z","title":"Agentic reinforced policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.139956Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:440131f1cff569239477baca8302525e09b1ee614004647480d94626f126df32","observation_id":"062dd9b9-b253-4590-8115-89169a1bba7f","resolution":{"observed_at":"2026-08-05T11:39:22.139956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-05T11:39:22.278687Z","title":"ReTool : Reinforcement Learning for Strategic Tool Use in LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.278687Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:f84fd251cb4830ae20c80ceff76bccffe8c5de863abd65e0badfb3736cacfa12","observation_id":"aca43fa9-b2ba-43ba-8dd0-fa865dff7efd","resolution":{"observed_at":"2026-08-05T11:39:22.278687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:27.325988Z","title":"Dean, and Craig Boutilier","venue":null,"work_id":"5abb808e-6abd-4e26-8400-8f4994856c39","year":1998},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.431007Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:8dd8038ebea0a28c40c89723085660259918ffb487350df411c52da8ebf95fc2","observation_id":"bb62df75-3fee-44be-a48d-9e4b13103466","resolution":{"observed_at":"2026-08-05T11:39:27.431990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:27.143922Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":null,"work_id":"826c34db-2bfd-41f1-8a3c-4c076cafbc40","year":2021},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.510306Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:87dd85444d697044dc0b4f60a758f139fa4a8720662cd9d2bc8e4d7abadf9c16","observation_id":"e6b85788-a3ea-44f3-b61c-e93e64009369","resolution":{"observed_at":"2026-08-05T11:39:27.219744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T11:39:22.593363Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.593363Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:a33ab12f43dfbba260f1c96e2107d9af6c23c03a15d5afdbb6cfc6b529a8fae8","observation_id":"16893c04-35ac-4ca2-8f93-79a6d4101784","resolution":{"observed_at":"2026-08-05T11:39:22.593363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T11:39:22.710331Z","title":"Search- R1 : Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.710331Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:3f928fd4fc8a9242ff2f33f586a5060271213321160d67003d152f3f9a8c9418","observation_id":"2d60a3c3-8f4a-46da-9d69-0c34540f9b59","resolution":{"observed_at":"2026-08-05T11:39:22.710331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11016","last_updated":"2025-08-24T13:33:47Z","snapshot_observed_at":"2026-08-19T07:13:32.342460Z","submitted_at":"2025-08-14T18:40:34Z","title":"CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11016","snapshot_observed_at":"2026-08-05T11:39:22.819067Z","title":"CURE: Critical-Token-Guided Re-concatenation for Entropy-collapse Prevention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.819067Z"},"links":{"cited_paper":"/paper/2508.11016","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:2c50eb73bdad8bfa867611a334d553d333611d1f3ddc539656893f2bba1c0a58","observation_id":"f129fb19-4881-43e6-9880-950cf7834823","resolution":{"observed_at":"2026-08-05T11:39:22.819067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-18T07:08:35.277799Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T11:39:22.953751Z","title":"ToRL : Scaling Tool-Integrated RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.953751Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:5d80cd430f81253aa70f055c2b0c61d73859f31c0d58e0ef7a577457eda8a04e","observation_id":"aa12c784-d0c1-47d4-9e2a-41d1e08b1339","resolution":{"observed_at":"2026-08-05T11:39:22.953751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12912","last_updated":"2025-06-15T17:02:39Z","snapshot_observed_at":"2026-08-18T06:28:21.369737Z","submitted_at":"2025-06-15T17:02:39Z","title":"Logit Dynamics in Softmax Policy Gradient Methods","version":1},"cited_work":{"arxiv_id":"2506.12912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12912","snapshot_observed_at":"2026-08-05T11:39:25.905065Z","title":"Logit Dynamics in Softmax Policy Gradient Methods","venue":"cs.LG","work_id":"1757984c-cd9d-46a7-b3f5-eec0be9cff9b","year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:23.104253Z"},"links":{"cited_paper":"/paper/2506.12912","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:58798ddbdbec1240410f1fc875b8fa16247fc8a211562629a1cc26a8413d7988","observation_id":"95da2a5e-6f43-4d90-bc06-f783947f2a9b","resolution":{"observed_at":"2026-08-05T11:39:25.983870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:26.901650Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","venue":null,"work_id":"f97fffa1-d47f-48e6-a9f1-da59e29d2c42","year":2024},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:23.251376Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:8090e0262a3e330983384cbac42dde37dfcea5e2ef3418ab0ed2fec7d7eff509","observation_id":"68007f4e-83cc-476b-a620-3e5e402546d5","resolution":{"observed_at":"2026-08-05T11:39:26.978676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19201","last_updated":"2025-08-26T17:03:46Z","snapshot_observed_at":"2026-08-15T16:55:05.018931Z","submitted_at":"2025-08-26T17:03:46Z","title":"Understanding Tool-Integrated Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19201","snapshot_observed_at":"2026-08-05T11:39:23.377485Z","title":"Understanding Tool-Integrated Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:23.377485Z"},"links":{"cited_paper":"/paper/2508.19201","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:086596f9abdfb124197f1581b6f650320015dbbf908e4e068523dc84e3015be0","observation_id":"656d61f4-b0e2-4ca8-a945-5f8df29c399b","resolution":{"observed_at":"2026-08-05T11:39:23.377485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T11:39:23.530235Z","title":"Prorl: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:23.530235Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:37ad020901266df8e2a37a772ced3a107d46641fc3265fc700f4b1319b13c350","observation_id":"185b89bf-3df2-45a3-ada4-b3de776752b5","resolution":{"observed_at":"2026-08-05T11:39:23.530235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T11:39:23.676782Z","title":"Understanding R1-Zero-like Training: A Critical Perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:23.676782Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:0c83d5eaa7c389c7ff3eddb19cb560f1501b0c9074198e8f4e7299590cce7016","observation_id":"bc9c65c1-49ea-4e09-a14e-86f4fcd3e5df","resolution":{"observed_at":"2026-08-05T11:39:23.676782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:26.710779Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"31f67784-ae89-4a28-b59d-c9ad26f3151d","year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:23.885010Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:f50058b0f109cc76f2e5078703fd50f91ed3e81c1b1163cedbb826d9578d9273","observation_id":"fa14734a-4921-4aa2-a9d5-daef1525768d","resolution":{"observed_at":"2026-08-05T11:39:26.799315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-08-16T03:27:31.121559Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-05T11:39:24.061038Z","title":"Agent RL Scaling Law : A gent RL with Spontaneous Code Execution for Mathematical Problem Solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.061038Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:1a325aae1f623d8579bc8a25f86c73fbdd207c5f193fc9cc65dd12f154fd21e4","observation_id":"8bb1be83-9bc9-4c92-9ae7-b325b209dc4b","resolution":{"observed_at":"2026-08-05T11:39:24.061038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:26.492502Z","title":"Kimi-Researcher: End-to-End RL Training for Emerging Agentic Capabilities","venue":null,"work_id":"bdd26b2f-35b4-4dce-929c-2aeed925a1cc","year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.223199Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:3669f9bd382f3c1f80d7cba302d7e3dbad199172431a2fdac6d0695814a1c9b9","observation_id":"27094400-20a4-4f5d-8c11-137218c4e3c5","resolution":{"observed_at":"2026-08-05T11:39:26.623796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T11:39:24.330070Z","title":"Proximal Policy Optimization Algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.330070Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:20fef9025e67b41fa1ea5a15d49846f48d0910c0b9a9c6e18621bdb63907b124","observation_id":"8b1e3065-ce6f-481a-a813-47345c27fdeb","resolution":{"observed_at":"2026-08-05T11:39:24.330070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T11:39:24.436677Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.436677Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:d270c7614e3523877e6ca08ce724b09ccd4b28403d45dbd92279aaca7cfd3a3a","observation_id":"2e244270-f369-4138-946c-852d0afebb79","resolution":{"observed_at":"2026-08-05T11:39:24.436677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-08-05T11:39:24.525311Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.525311Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:b3348844dfbec0a0672ad2b3bab2d153c7d963f5b5fe5083724084105de39af0","observation_id":"0900ce65-3114-406d-b631-cf22dd7b6e5f","resolution":{"observed_at":"2026-08-05T11:39:24.525311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-05T11:39:24.627187Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.627187Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:c5daabab714eadd76aeaaf0ec50962551743ed8aab3761b7685a040d487a777f","observation_id":"a308f37a-c074-4895-97cd-db536de8835a","resolution":{"observed_at":"2026-08-05T11:39:24.627187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:26.326822Z","title":"Divergence-augmented policy optimization","venue":null,"work_id":"6523b59c-7cb7-482e-aeb6-28aca43cb8d4","year":2019},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.700391Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:8440688863f3930aafe8f186dc7ecfc565f216cfa4966b1fd49923ca2d6117a3","observation_id":"bf7ddfff-1716-4aef-81f3-9a389bb5ebfb","resolution":{"observed_at":"2026-08-05T11:39:26.414168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T11:39:24.770094Z","title":"RAGEN: Understanding Self-evolution in LLM Agents via Multi-turn Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.770094Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:972010e6f52e4eeea04f0991a5c42543c67d0be46287a235cb11bda9de7ea2b5","observation_id":"2beff123-71bc-4bc3-bd4c-76dbac3f7860","resolution":{"observed_at":"2026-08-05T11:39:24.770094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:26.165090Z","title":"Your Efficient RL Framework Secretly Brings You Off-Policy RL Training","venue":null,"work_id":"bf0f8ab0-9478-49c2-94e7-4f471c005427","year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.867017Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:d16aaf73deb088f47ac09d8e92329be6d909cc02b466e24010ad0d8f6a36b5b2","observation_id":"e8576bfa-7340-4826-bebb-5d6786874288","resolution":{"observed_at":"2026-08-05T11:39:26.233721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T11:39:24.939131Z","title":"DAPO : An Open-Source LLM Reinforcement Learning System at Scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.939131Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:8e670b0e0539b2ba74b36617d7a519c90cd0fb5c9975f15f72085c41d14e330d","observation_id":"c9111b61-3ccb-4206-a04b-fe2f9936071c","resolution":{"observed_at":"2026-08-05T11:39:24.939131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-05T11:39:25.032006Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:25.032006Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:32715bf0c31688f1e89063b876365510346337c6d78066a3f9aa82428d7e3930","observation_id":"741430aa-f2dd-4067-afb3-fb19b8582aa8","resolution":{"observed_at":"2026-08-05T11:39:25.032006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-19T11:40:26.978263Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-05T11:39:25.091160Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:25.091160Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:4e8a82525320954e65139abc08df16f8bd1b5682eabd681ac8963f1f084bdd20","observation_id":"c7f2a4b8-a266-44fe-b9f7-48d2ba1cb883","resolution":{"observed_at":"2026-08-05T11:39:25.091160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:25.219497Z","title":"Geometric-Mean Policy Optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:25.219497Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:ff2061ca1b8868093410d1788a7447abea5475d2218127f59da1f25109a0c382","observation_id":"9fd22fb0-2e4d-4989-8d55-aae81c84c9ca","resolution":{"observed_at":"2026-08-05T11:39:25.219497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-21T02:04:30.074424Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T11:39:25.423245Z","title":"Group Sequence Policy Optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:25.423245Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:62a9441d03bd55d35e638de8972464116b85a3b6053376bd06ac72673571a07d","observation_id":"e524eb84-a13d-49ce-86c1-ab3c70b72080","resolution":{"observed_at":"2026-08-05T11:39:25.423245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:39:25.500635Z","title":"The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:25.500635Z"},"links":{"citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:d33030c906173868498e6b86e9b48c84f97764d46cb899debd3e000e60267552","observation_id":"adb6998a-e01d-4627-9cd3-e36056005c2b","resolution":{"observed_at":"2026-08-05T11:39:25.500635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 34 inbound Pith citation observations for arXiv:2509.02479."}