{"as_of":"2026-08-11T02:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a0cd5038ea98135af38f967afdc48627a7285adc29673c3fa085a986a672d64","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:42:57.596073Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T10:51:49.150058Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T06:17:41.457622Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2604.09813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09813","snapshot_observed_at":"2026-07-03T06:17:41.457622Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","venue":"cs.AI","work_id":"28693770-47a3-4219-9eae-3ec95f73e0e4","year":2026},"citing_paper":{"arxiv_id":"2606.09498","last_updated":"2026-06-08T13:50:23Z","snapshot_observed_at":"2026-08-01T16:17:07.275923Z","submitted_at":"2026-06-08T13:50:23Z","title":"Self-Harness: Harnesses That Improve Themselves","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T16:25:59.583722Z"},"links":{"cited_paper":"/paper/2604.09813","citing_paper":"/paper/2606.09498"},"observation_digest":"sha256:4227604eca331f97671ae73d7bc6a97ac68026db94cf6cb608bf58333e793a11","observation_id":"a3dce4b8-7dbf-4055-b5de-780c09e98c4f","resolution":{"observed_at":"2026-07-03T01:37:30.758061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2604.09813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09813","snapshot_observed_at":"2026-07-03T06:17:41.457622Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","venue":"cs.AI","work_id":"28693770-47a3-4219-9eae-3ec95f73e0e4","year":2026},"citing_paper":{"arxiv_id":"2606.11520","last_updated":"2026-07-14T14:04:47Z","snapshot_observed_at":"2026-08-09T21:59:48.919495Z","submitted_at":"2026-06-09T23:44:26Z","title":"ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T12:50:32.024037Z"},"links":{"cited_paper":"/paper/2604.09813","citing_paper":"/paper/2606.11520"},"observation_digest":"sha256:4bcee64875092e37d2a609b5c8c4b2f17c23ce262d16cebff1415afd30b994fb","observation_id":"839dbf13-bc8a-4ab0-8cf5-05b9beee734b","resolution":{"observed_at":"2026-07-03T06:17:41.458718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09813","snapshot_observed_at":"2026-07-14T18:06:15.668254Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11520","last_updated":"2026-07-14T14:04:47Z","snapshot_observed_at":"2026-08-09T21:59:48.919495Z","submitted_at":"2026-06-09T23:44:26Z","title":"ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T18:06:15.668254Z"},"links":{"cited_paper":"/paper/2604.09813","citing_paper":"/paper/2606.11520"},"observation_digest":"sha256:9d61fa700acd79cb85729aec8a6ce22ed1db9628bf89db498e960a3c0a30dc97","observation_id":"6564216d-952f-4fbc-9e07-2106d0e4b9a4","resolution":{"observed_at":"2026-07-14T18:06:15.668254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09813","snapshot_observed_at":"2026-07-15T10:51:49.150058Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11520","last_updated":"2026-07-14T14:04:47Z","snapshot_observed_at":"2026-08-09T21:59:48.919495Z","submitted_at":"2026-06-09T23:44:26Z","title":"ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-15T10:51:49.150058Z"},"links":{"cited_paper":"/paper/2604.09813","citing_paper":"/paper/2606.11520"},"observation_digest":"sha256:7e15a3ac949a12566b42d35adffec481ea61d4346b78680b06d3eb48e9993e0e","observation_id":"91a0a6a0-d313-4f33-82b8-7b8caf8ad1a1","resolution":{"observed_at":"2026-07-15T10:51:49.150058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.09813/citation-record","integrity":"/paper/2604.09813/integrity","json":"/paper/2604.09813/citation-record.json","paper":"/paper/2604.09813"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:d169ae86e4026edc86e41700f499aa4e7518a09d7ccd4af11d6c41db2d7692a5","observation_id":"2a48a16c-d056-44fb-abb2-bd30a5ea30d4","resolution":{"observed_at":"2026-05-11T06:15:58.383999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACEBench: A comprehensive evaluation of LLM tool usage","venue":null,"work_id":"5238c85c-65f7-40b1-96dc-a76589aa7831","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:a9f018f91ae0dce2bb8aa0b4e578ffab5a87aef735ef6ebe0f48d840c6507075","observation_id":"2e1ef6d0-3e73-4dca-b380-23626a4f0f54","resolution":{"observed_at":"2026-05-17T09:21:42.412735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:280165b111fee0b3166ffd88db3d0762958ddc73504bb9977407507bb7003602","observation_id":"0228cd66-9920-4712-8975-047fea47bd8b","resolution":{"observed_at":"2026-05-11T06:15:58.314264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:9963a198e17f5b1b967d8a0995c117f529ef74d6d47ea5d0652d7c2c1e0fc971","observation_id":"a12954aa-5646-4123-8c45-5fdc45970949","resolution":{"observed_at":"2026-05-11T06:15:58.352308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13542","last_updated":"2024-07-18T09:00:23Z","snapshot_observed_at":"2026-08-03T22:34:13.223301Z","submitted_at":"2024-06-19T13:29:53Z","title":"Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.13542","doi":"10.48550/arxiv.2406.13542","metadata_source":"pith","pith_arxiv_id":"2406.13542","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-play with execution feedback: Improving instruction-following capabilities of large language models","venue":"cs.CL","work_id":"4820f50e-98c1-439f-89eb-e74ebe6bbb59","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2406.13542","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:92c24b56b86a0192e7819b623a4437c57f92ec8ab7bc4b11b6a47a211b5d1cb3","observation_id":"3b2fdd94-5aee-4d3f-bfab-ed9564a2531c","resolution":{"observed_at":"2026-05-11T06:15:58.434072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.16410","doi":"10.48550/arxiv.2505.16410","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool-star: Empowering LLM-brained multi-tool reasoner via reinforcement learning","venue":"ArXiv.org","work_id":"4b5aa09c-2d1c-4591-888d-3e9aa8a1a0dc","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:7c854b7ae84a813a39f4b5ad5552c03663641cb9406df19fb5afccb165b4a071","observation_id":"3bee09b4-f1f4-4348-9163-07973725b8ee","resolution":{"observed_at":"2026-05-11T06:15:58.424047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":"2504.11536","doi":"10.48550/arxiv.2504.11536","metadata_source":"pith","pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","venue":"cs.CL","work_id":"6da510e4-e55c-4412-b7c8-839984508e99","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:4674c23cf47bc7a1b9a107592fc2680d821c21a568fc0df5ca460499cbfd7a28","observation_id":"df7b1487-51d2-4972-aa70-6f4f06910a27","resolution":{"observed_at":"2026-05-13T18:42:39.160125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:eee4cc0bee2e776656e8860b3dbe40c34c26dcd2a9e0a1b52dff4f36ab515822","observation_id":"1027fdd9-2fe5-4d0a-8b08-6c6c3423f5e0","resolution":{"observed_at":"2026-05-11T06:15:58.374374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:c59d67b40d475fd8868746d2d7956490a264aef2c14d17e0cc68efd4a8a8b594","observation_id":"fedd6105-1690-436c-bbcf-1d32489fe748","resolution":{"observed_at":"2026-05-11T06:15:58.320896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:17959ddcab0b2ba076dfc62411466f4bde5bfca18c9b6478f68ee0d531d05c0d","observation_id":"dc0b1aa1-6763-4ac1-bf84-09758f5a60f2","resolution":{"observed_at":"2026-05-11T06:15:58.417191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:a6cdb2fb0eb7dc43036fac32fd9c421b1fe223c12887c141cefb54a77fbda295","observation_id":"1299f762-cae7-4419-bd9c-961a4541a2a2","resolution":{"observed_at":"2026-05-11T06:15:58.332777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"cited_work":{"arxiv_id":"2504.21776","doi":"10.48550/arxiv.2504.21776","metadata_source":"pith","pith_arxiv_id":"2504.21776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","venue":"cs.CL","work_id":"7e319d34-eb88-4ea9-8c0d-b66320599f98","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2504.21776","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:e714c6256bec4d47581061ba879392415ffd99bebefb6114bceb33f4612290fc","observation_id":"aaae4ea5-9845-40fa-ac4a-7087271c8ff9","resolution":{"observed_at":"2026-05-16T19:14:25.573630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00920","last_updated":"2025-07-25T08:26:54Z","snapshot_observed_at":"2026-08-10T22:36:42.916898Z","submitted_at":"2024-09-02T03:19:56Z","title":"ToolACE: Winning the Points of LLM Function Calling","version":2},"cited_work":{"arxiv_id":"2409.00920","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00920","snapshot_observed_at":"2026-07-05T04:40:40.695053Z","title":"ToolACE : Winning the points of LLM function calling","venue":null,"work_id":"1186dcff-a8d4-4766-84c4-1cda266a9852","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2409.00920","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:fb1aee0fc2b404fa7523d3d52fadf978870da50d18993be21531af202bc7a348","observation_id":"a2fa7022-5196-40be-9c43-36bd6202a94a","resolution":{"observed_at":"2026-05-11T06:15:58.399755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14158","last_updated":"2024-03-13T16:38:42Z","snapshot_observed_at":"2026-08-04T20:24:21.044684Z","submitted_at":"2024-02-21T22:41:38Z","title":"TOOLVERIFIER: Generalization to New Tools via Self-Verification","version":2},"cited_work":{"arxiv_id":"2402.14158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14158","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolverifier: Generalization to new tools via self-verification","venue":null,"work_id":"1273b58d-c08d-4609-b3fd-3820c44c2590","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2402.14158","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:38eedaf61eaa75ff5be2c94fd0b44ac20e5e5c510935b399ff08c2f802b5c1c5","observation_id":"337a4ddc-e4b1-44d0-823f-65e96345c522","resolution":{"observed_at":"2026-05-11T06:15:58.348335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03601","last_updated":"2025-07-19T17:39:17Z","snapshot_observed_at":"2026-08-07T20:27:54.118684Z","submitted_at":"2025-04-04T17:13:57Z","title":"APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay","version":4},"cited_work":{"arxiv_id":"2504.03601","doi":"10.48550/arxiv.2504.03601","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.03601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Apigen-mt: Agentic pipeline for multi-turn data generation via simulated agent-human interplay","venue":"ArXiv.org","work_id":"57da2252-8f38-4ac6-8459-00c0bfce1f9a","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2504.03601","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:cf9601481ae3d73f067796cfb775410373936bea787d035258f7eac859d475a4","observation_id":"4f8a772b-a391-49ea-8f66-73147bec2f8c","resolution":{"observed_at":"2026-05-11T06:15:58.440030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:0a38b4fff1938674daeb54d39840ed57d2d7fcebd1d855cfa68516fbdc9d7d21","observation_id":"41293427-805d-4b3b-9ba2-ff1f1a2d4cc7","resolution":{"observed_at":"2026-05-14T00:26:48.594660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":"2307.16789","doi":"10.48550/arxiv.2307.16789","metadata_source":"pith","pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","venue":"cs.AI","work_id":"3c555b48-a4d9-42dd-9fdd-0f6018fbe9cb","year":2023},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:8ed027c66c5a7b3db5005dc685a9a46e949d91d68017e46d575e890dd47e0f57","observation_id":"bb5e4a6c-96e2-418f-b15c-d07f9f1b7fda","resolution":{"observed_at":"2026-05-11T06:15:58.427470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:33.730697+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:33.730697+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:52c39e5261df95c3b75e22904f369eb98733f66b139f5f5b60892866b5edd788","observation_id":"af733ace-3d13-47ef-9b86-ef62003310d8","resolution":{"observed_at":"2026-05-11T06:15:58.430570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04494","last_updated":"2025-01-10T22:22:41Z","snapshot_observed_at":"2026-07-06T20:02:26.756229Z","submitted_at":"2024-11-28T19:36:11Z","title":"MAG-V: A Multi-Agent Framework for Synthetic Data Generation and Verification","version":2},"cited_work":{"arxiv_id":"2412.04494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04494","snapshot_observed_at":"2026-07-02T07:16:44.634744Z","title":"MAG-V: A multi-agent framework for synthetic data generation and verification","venue":null,"work_id":"e8d3ee95-571d-453e-bf13-438e4246347e","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2412.04494","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:37365888b5300edd483aa7b891716f6c89baa37cd959dc829f93ca3efd2a9e76","observation_id":"184d6aba-7896-488f-871c-4fccb92e99f3","resolution":{"observed_at":"2026-05-11T06:15:58.359612Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:f8b5343c566b22fc7a96085290da9f10809682f5d8cab90263977a328cd7e710","observation_id":"ad2b3bff-3eaf-4f4b-a720-2929b3984cec","resolution":{"observed_at":"2026-05-11T06:15:58.369297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":"2009.01325","doi":"10.18653/v1/2022.naacl-main.6","metadata_source":"pith","pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to summarize from human feedback","venue":"cs.CL","work_id":"1fae7759-93bb-4cba-a0d5-ebff515b9d39","year":2020},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:b8767c8367cfd3e6991e05a17ee6e0956a2d86d1423cc85a65d8acfa808f579c","observation_id":"d9078486-3645-49ec-834b-94e382ce929d","resolution":{"observed_at":"2026-05-18T01:46:18.838660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05301","last_updated":"2023-09-07T12:20:45Z","snapshot_observed_at":"2026-07-06T15:40:20.267344Z","submitted_at":"2023-06-08T15:46:32Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","version":2},"cited_work":{"arxiv_id":"2306.05301","doi":"10.48550/arxiv.2306.05301","metadata_source":"pith","pith_arxiv_id":"2306.05301","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","venue":"cs.CL","work_id":"e900f660-9178-4fda-ad54-a788e23aa0d8","year":2023},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2306.05301","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:f31538f9ea6d89d66ce971560393585ef38cd6805b04771ad82227fdd4b64ae7","observation_id":"2956b9cd-8e75-45cf-834e-dd5614a155ee","resolution":{"observed_at":"2026-05-15T23:03:48.638764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20367","last_updated":"2025-08-07T08:34:03Z","snapshot_observed_at":"2026-08-10T23:21:29.606520Z","submitted_at":"2024-12-29T06:15:41Z","title":"Enhancing Code LLMs with Reinforcement Learning in Code Generation: A Survey","version":5},"cited_work":{"arxiv_id":"2412.20367","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20367","snapshot_observed_at":"2026-07-11T03:57:46.638644Z","title":"Enhancing code llms with reinforcement learning in code generation: A survey","venue":"cs.SE","work_id":"de0ce633-d3af-4711-b0eb-ba6dc92ce4b5","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2412.20367","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:f11dd66e9dacad206c00a757077ecbd971de92f2e744f1a3a52343d265abccaf","observation_id":"c8f42a8a-04ff-4e18-bd40-d830c11ff778","resolution":{"observed_at":"2026-05-11T06:15:58.454071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":"2406.01574","doi":"10.1145/3711896.3737413","metadata_source":"pith","pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","venue":"cs.CL","work_id":"3c028052-035a-4c22-b80e-3046edb44adc","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:343e5f695bdc1de269fee893c1671812cfd7a505df2ce1a4c3aa01a3f4131d89","observation_id":"79092f1e-a2f9-4337-bc51-0762e73a6eab","resolution":{"observed_at":"2026-05-11T15:51:14.588885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:8f356ecf13519f3c713676ce36c436ba62d7683738445b2175650f569e3c221c","observation_id":"a3b8105b-edbf-4495-a4e3-724718ddd16d","resolution":{"observed_at":"2026-05-11T06:15:58.387819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tool zero: Training tool- augmented LLMs via pure RL from scratch","venue":null,"work_id":"00340afb-49e1-449e-9cb7-06e5f40e80c6","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:b6f10e13a4d661ad7a8dbba44638d744de7324007c23b711317c32e8742a7e16","observation_id":"d058348d-18c5-4724-9f93-7e57fdc6e283","resolution":{"observed_at":"2026-05-17T09:21:42.416492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-07T15:59:20.025064Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:5ae6c5f5788e68b74c9d5aa85ce46bcc01d647661235af8f006b668062ad653d","observation_id":"f7167414-ff93-4c04-9fb4-de6f59864fb9","resolution":{"observed_at":"2026-05-11T06:15:58.363701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If none of the functions can be used, point it out","venue":null,"work_id":"dde5f86f-4c4d-4c84-a4b1-e82f58fd0ce5","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:4eaf29f0ec3fb7732367e86b93e934842484589f59d1eee281f0285a6ffbc25a","observation_id":"97607fd0-4a28-49a4-a0e6-f3e2e6b5f161","resolution":{"observed_at":"2026-05-17T09:21:42.419917Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":2},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 4 inbound Pith citation observations for arXiv:2604.09813."}