{"as_of":"2026-08-08T01:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4079681df702c6a99a8f822b396977c4984048abd524e456e3721b6ff5ed0cf8","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:40:04.944348Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.08281/citation-record","integrity":"/paper/2604.08281/integrity","json":"/paper/2604.08281/citation-record.json","paper":"/paper/2604.08281"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24480","last_updated":"2025-05-30T11:30:18Z","snapshot_observed_at":"2026-08-07T20:40:53.644357Z","submitted_at":"2025-05-30T11:30:18Z","title":"Towards Effective Code-Integrated Reasoning","version":1},"cited_work":{"arxiv_id":"2505.24480","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24480","snapshot_observed_at":"2026-07-04T00:29:16.476770Z","title":"arXiv preprint arXiv:2505.24480 , year=","venue":null,"work_id":"2cc5a72d-fc1e-48c3-8510-6d7d0e981a19","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2505.24480","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:3cf46428094481dacb4221f543ff4fe0681f6bb1d9de702a846c36bca851d266","observation_id":"dd53767b-748b-4471-9dbd-f3016e2aa60a","resolution":{"observed_at":"2026-05-11T00:10:52.038322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07115","last_updated":"2025-03-21T08:12:07Z","snapshot_observed_at":"2026-07-06T18:28:47.000729Z","submitted_at":"2024-06-11T10:00:18Z","title":"Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees","version":2},"cited_work":{"arxiv_id":"2406.07115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07115","snapshot_observed_at":"2026-07-03T05:57:41.404638Z","title":"Wenhu Chen, Xueguang Ma, Xinyi Wang, and William W","venue":null,"work_id":"72eadd36-2845-47a9-8001-663b2d87f721","year":2024},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2406.07115","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:b3a26106793a9f5f128ef941f0812908cd1ea25e1a6b7a90c76fc741de543fb6","observation_id":"cd8f44a1-6b22-4fc3-a655-6db80bec34ac","resolution":{"observed_at":"2026-05-11T00:10:52.005112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":"2211.12588","doi":"10.48550/arxiv.2211.12588","metadata_source":"pith","pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","venue":"cs.CL","work_id":"618aa44c-a6c6-425c-abce-8aa8aa842921","year":2022},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:1be85ea80cd44c018b6460ec52daa24466b2ff831618eeab4a68dd6a1d71d325","observation_id":"6bc8e2bb-e8d0-4ba4-b5f2-eeaec112af9a","resolution":{"observed_at":"2026-05-12T16:48:28.215201Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:78ebb3a823e0ae1010cec40f320627437dd2ecaa0efdf2c4b753ddfee688097f","observation_id":"bffedbb6-2733-4bce-bb74-cceabf811d40","resolution":{"observed_at":"2026-05-11T00:10:51.967269Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":"2504.11536","doi":"10.48550/arxiv.2504.11536","metadata_source":"pith","pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","venue":"cs.CL","work_id":"6da510e4-e55c-4412-b7c8-839984508e99","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:0e7e344b1e84b1a6a2dd76321bcc38aabdf187d7d0a8a69c882dacd225a925d6","observation_id":"c0930de6-4bba-4113-8d27-c6b468b153e4","resolution":{"observed_at":"2026-05-13T18:42:39.160125Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2309.17452","doi":"10.48550/arxiv.2309.17452","metadata_source":"pith","pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","venue":"cs.CL","work_id":"8534cb5e-3749-4533-bc6f-1d85f32f41c8","year":2023},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:8e511295b9a11e9d7ffe33eae52f6531756c66f1750199598340f02894545e5c","observation_id":"d68304a6-81f7-4faa-993a-71171eb4145e","resolution":{"observed_at":"2026-05-19T09:19:36.299641Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:84bbabf3ca9ae62e71178a25baff2df640d5615bc83d6c6201c0c99e76f1ff6f","observation_id":"33ff1095-b5be-4636-983c-d8d5474d34db","resolution":{"observed_at":"2026-05-11T08:38:21.105975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:b812b176e8d3692952d68674a5e9bfa22e042717017312a27a010f4f31c77ec4","observation_id":"7023ca10-0f45-42eb-ae76-9d80afed8f29","resolution":{"observed_at":"2026-05-11T00:10:51.809554Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02497","last_updated":"2025-06-29T06:49:52Z","snapshot_observed_at":"2026-07-06T20:16:44.607678Z","submitted_at":"2025-01-05T10:24:20Z","title":"A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning","version":3},"cited_work":{"arxiv_id":"2501.02497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02497","snapshot_observed_at":"2026-07-03T20:08:56.359389Z","title":"Test-time computing: from system-1 thinking to system-2 thinking.ArXiv, abs/2501.02497","venue":null,"work_id":"5f9fb76e-a884-45b1-a36b-14e0afc8177a","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2501.02497","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:117f59987646018a72ac206e2beecc20a59d7b37ce4a68f6f1b50bfc332a333e","observation_id":"dd95223d-b222-4984-a9d0-b17a751b4e90","resolution":{"observed_at":"2026-05-11T00:10:51.833091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.01055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.476341Z","title":"Verltool: Towards holistic agentic reinforcement learning with tool use","venue":null,"work_id":"b23dbbef-f1e5-4b1a-8ae5-6dcca5e78dc8","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:743079b0fc90b0352deca944b79c854d1b8b1df2235b464401a954bdb0f6b8cd","observation_id":"c847739a-4edf-41da-9f3d-64a043f6aa25","resolution":{"observed_at":"2026-05-11T00:10:51.862893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":"2206.14858","doi":"10.48550/arxiv.2206.14858","metadata_source":"pith","pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving Quantitative Reasoning Problems with Language Models","venue":"cs.CL","work_id":"17214d12-1ca8-4186-806d-53c6715383a0","year":2022},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:c5d64c0dd33929d1ac2a4be8f03edb2b9bc3d20d218c8ad9a3a4285dca8f8f3f","observation_id":"8bd07ec3-655d-4c5e-84b1-1a69196829ea","resolution":{"observed_at":"2026-05-12T22:43:59.458883Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:d0e723d4c2c9b17d7492ff8cea5e8a0ff076f487adcca204ed8a7f91ddd75c3c","observation_id":"706f8afb-266d-4440-9298-f4ad4fa4182c","resolution":{"observed_at":"2026-05-11T00:10:51.855593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08190","last_updated":"2024-02-21T20:28:13Z","snapshot_observed_at":"2026-07-30T23:49:06.775533Z","submitted_at":"2024-01-16T08:08:01Z","title":"MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline","version":3},"cited_work":{"arxiv_id":"2401.08190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08190","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mario: Math reasoning with code interpreter output–a reproducible pipeline","venue":null,"work_id":"6682ba0d-f9f8-48e9-9ffc-8bbe6fe6af5a","year":2024},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2401.08190","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:01368724ffd91d1d7f30bf4a7b8ffa1830970b6f3bbade37599f2be582ef0132","observation_id":"dd5ff0f8-0efb-4d9c-bd16-252e30423efd","resolution":{"observed_at":"2026-05-11T00:10:51.842353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19201","last_updated":"2025-08-26T17:03:46Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:03:46Z","title":"Understanding Tool-Integrated Reasoning","version":1},"cited_work":{"arxiv_id":"2508.19201","doi":"10.48550/arxiv.2508.19201","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19201","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding tool-integrated reasoning","venue":"arXiv (Cornell University)","work_id":"d7b833e3-8bfb-4ff0-b539-8c12f6ef11e0","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2508.19201","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:99039215759b835203bad897c21152f36eb65af95e34f93a6c4d0c0c59ae4156","observation_id":"6217a3c3-343b-4917-99df-1cf683c119fe","resolution":{"observed_at":"2026-05-11T00:10:51.828913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:7d4e605a34fc087627d66f678f8f4f58469d3290fe31ed3d1220559f178a6206","observation_id":"055f80da-9432-42e1-97d7-410cc339086d","resolution":{"observed_at":"2026-05-11T00:10:52.010740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:9241d6a4568f554bee058caeadaec4ae8ac882e30ec887de753928bd3f6c79d6","observation_id":"d7254d70-0eb1-4616-821b-3653dcc955c6","resolution":{"observed_at":"2026-05-11T00:10:52.019493Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11435","last_updated":"2025-05-24T05:48:39Z","snapshot_observed_at":"2026-08-07T18:13:44.212380Z","submitted_at":"2025-02-17T04:50:37Z","title":"SMART: Self-Aware Agent for Tool Overuse Mitigation","version":2},"cited_work":{"arxiv_id":"2502.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11435","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SMART: Self-aware agent for tool overuse mitigation","venue":null,"work_id":"fcb21601-65e2-4435-98aa-6313747da7f1","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2502.11435","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:ad01808d3b45b769754956a99a80f3e7ce0bbedd67e4a1bdfce501bbf26fe025","observation_id":"2c8aa046-6906-4a42-be86-8edecfbf0fd4","resolution":{"observed_at":"2026-05-11T00:10:51.814683Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13996","last_updated":"2024-01-25T07:47:49Z","snapshot_observed_at":"2026-08-03T10:55:26.752756Z","submitted_at":"2024-01-25T07:47:49Z","title":"Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution","version":1},"cited_work":{"arxiv_id":"2401.13996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13996","snapshot_observed_at":"2026-07-02T21:27:24.661817Z","title":"Preprint","venue":null,"work_id":"f6d10aab-3f49-4ca9-80c1-885e7111c974","year":2024},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2401.13996","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:03c191b9c2ced4bd7bf3c2f950bb81ee025332966a5f10a29715f5b097a27830","observation_id":"d11f3304-90ae-4035-a176-e495a08f3d0d","resolution":{"observed_at":"2026-05-11T00:10:51.987975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":"2302.04761","doi":"10.48550/arxiv.2302.04761","metadata_source":"pith","pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","venue":"cs.CL","work_id":"9bce40c8-cfd7-4983-80e0-c3bd4402322a","year":2023},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:2b20ef93f57d6de6b5b46422d67276941ab0701edf1bf88b4f4d3545ec65c51c","observation_id":"addcfd2e-eb33-427d-a661-d6946ce149b3","resolution":{"observed_at":"2026-05-11T00:10:51.846542Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:11.107254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:11.107254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:fb24644ce23872f1bb12106b875dc9992f7286dc4ce8373d6bb0e9d288dc27e9","observation_id":"2638a5f5-5176-4f85-9fef-8c46abadfa1b","resolution":{"observed_at":"2026-05-11T00:10:51.922002Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11520","last_updated":"2025-02-17T07:41:27Z","snapshot_observed_at":"2026-08-07T18:13:27.518580Z","submitted_at":"2025-02-17T07:41:27Z","title":"AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification","version":1},"cited_work":{"arxiv_id":"2502.11520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11520","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aurora: Automated training framework of universal process reward models via ensemble prompting and reverse verification.arXiv preprint arXiv:2502.11520","venue":null,"work_id":"d0454189-99a6-45c6-b595-435b8ff9b2e5","year":null},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2502.11520","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:210f9f515359b7d7962ba6cb736bb93e0185daf1e67ecdf68f97654ee26a9953","observation_id":"441af691-9c6f-4d35-b3fc-0d254c6c9a3c","resolution":{"observed_at":"2026-05-11T00:10:51.888146Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:8d1062a0cf24f1b3d0404c7a1f59620a121b6741e2a2d2eb28f31352206a553c","observation_id":"e4b0f791-657c-4041-93fe-aa3fc1ee980a","resolution":{"observed_at":"2026-05-11T00:10:51.880855Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13514","last_updated":"2025-01-25T22:44:29Z","snapshot_observed_at":"2026-08-04T11:02:35.592597Z","submitted_at":"2024-02-21T03:55:02Z","title":"Self-DC: When to Reason and When to Act? Self Divide-and-Conquer for Compositional Unknown Questions","version":2},"cited_work":{"arxiv_id":"2402.13514","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13514","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-dc: When to reason and when to act? self divide-and-conquer for compositional unknown questions","venue":null,"work_id":"c75f73f8-b075-4cf3-946d-b77eaf8e02b3","year":2024},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2402.13514","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:755a062ee947239198e8aaf1c162a0fdb61c0a61304adde0fb63afbaf9e89c3f","observation_id":"7d5c51e3-d35e-41d7-a2d4-336af7aa145a","resolution":{"observed_at":"2026-05-11T00:10:52.001074Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03731","last_updated":"2023-10-05T17:52:09Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:52:09Z","title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2310.03731","doi":"10.48550/arxiv.2310.03731","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning","venue":"arXiv (Cornell University)","work_id":"36308722-f027-40ce-b4e0-8d2c26bb0f9e","year":2023},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2310.03731","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:b36cbe349e26a301a8760dd4bfcb76a3d4102f33d6dceef6649e974919fdfb17","observation_id":"89d6c9af-5f35-4ab9-8d2f-62e75f435b0e","resolution":{"observed_at":"2026-05-11T00:10:52.026754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-07T15:24:21.164792Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":"2509.02479","doi":"10.48550/arxiv.2509.02479","metadata_source":"pith","pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleTIR: End-to-end reinforcementlearningformulti-turntool-integratedreasoning.arXivpreprint","venue":"cs.LG","work_id":"7fab711c-66c5-439e-b937-3b87965f8efb","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:cc6f2d175bfdabfe2793c03cb754108b9251dd241ff33fe8768e0e790acbc2bd","observation_id":"560baf11-4602-4904-9981-a6ab9380935c","resolution":{"observed_at":"2026-05-11T00:10:51.983542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:8908f6d6753effa0e2520b3c2fc07f058fd6ebca88d6ff6619bf646bc549052a","observation_id":"39d359b2-6d68-430e-a9b4-e6a8baa593d4","resolution":{"observed_at":"2026-05-11T00:10:51.909980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:b166065fbb99325a4b2f8d3125c1755f969eab47e6d37b88a4ac19106e8d0d38","observation_id":"77eee5fb-cf38-463a-953c-49625c040928","resolution":{"observed_at":"2026-05-11T00:10:51.957290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17428","last_updated":"2024-03-13T05:39:25Z","snapshot_observed_at":"2026-07-31T00:22:58.299806Z","submitted_at":"2023-09-29T17:40:26Z","title":"CRAFT: Customizing LLMs by Creating and Retrieving from Specialized Toolsets","version":2},"cited_work":{"arxiv_id":"2309.17428","doi":"10.48550/arxiv.2309.17428","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17428","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Craft: Customizing llms by creating and retrieving from specialized toolsets","venue":"arXiv (Cornell University)","work_id":"1a7f7aaf-b34d-43fe-8d9b-eef916bfc25d","year":2023},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2309.17428","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:9bcd05958dba43082d77f8792ee5aae580b36e2a302113eb79a254c8d7241682","observation_id":"ca26a0d6-a4d6-43d0-a853-ce322c4ec1b2","resolution":{"observed_at":"2026-05-11T00:10:52.030923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:6f57a7ea535ed303e2552a383d7ea5e1813b4ba2104c1370d70c4a9a14ef6462","observation_id":"eea5b48b-db5d-4ab1-973a-4f75a0a444ae","resolution":{"observed_at":"2026-05-11T00:10:51.819974Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":"2503.18892","doi":"10.48550/arxiv.2503.18892","metadata_source":"pith","pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","venue":"cs.LG","work_id":"94a68437-02e7-425a-91b2-5846ddcbd38c","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:4bad5a9ac4e62ef993a897802e96502a03e39806f3515a506bc9998ff44e96c5","observation_id":"1c7f3138-b71d-4bc3-901c-74718f55897a","resolution":{"observed_at":"2026-05-13T08:21:05.971096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:5ae58940b46e84ddd69d14a4acfc531f76807aa5a66561761895d5bfbe170657","observation_id":"6f568f6e-0550-458b-968a-00aa044533bb","resolution":{"observed_at":"2026-05-11T00:10:51.948794Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":23,"parse_uncertain":0,"unresolved":0,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2604.08281."}