{"as_of":"2026-08-06T19:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5022bf70e5a33b51387df35f0fab18319786e9eb595e97d17e1d32e33fa0cd6f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:23:55.198073Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.263901Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-06T12:23:55.198073Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21836","last_updated":"2025-07-29T14:12:28Z","snapshot_observed_at":"2026-08-06T12:23:53.267663Z","submitted_at":"2025-07-29T14:12:28Z","title":"AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T12:23:55.198073Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2507.21836"},"observation_digest":"sha256:ae777bb8aa3e7e5c4352ece952637f44ab18f1967b7e2d4747061f7af10d1a7d","observation_id":"180f9b04-4a4c-4050-8278-f640fa91051b","resolution":{"observed_at":"2026-08-06T12:23:55.198073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-05T23:57:33.803769Z","title":"Agent rl scaling law: Agent rl with spontaneous code execution for mathematical problem solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13167","last_updated":"2025-08-06T17:01:02Z","snapshot_observed_at":"2026-08-05T23:57:29.481263Z","submitted_at":"2025-08-06T17:01:02Z","title":"Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T23:57:33.803769Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2508.13167"},"observation_digest":"sha256:d4ba6ebb09ebcb8b6aedd63226cc3442e19c8b53ff4d18d87a5359a57ddb352d","observation_id":"82b74efe-b908-4be7-8a9d-f20ce2219763","resolution":{"observed_at":"2026-08-05T23:57:33.803769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-05T14:57:39.441530Z","title":"Xinji Mai, Haotian Xu, Weinong Wang, Yingying Zhang, Wenqiang Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-05T14:57:38.336407Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.441530Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:95619cbd03cf0cf6b63112ba227000569bc6a9b9a5e0a990fa0d6a0c9ce25b6f","observation_id":"4e85ad13-c4e7-40ce-8ed5-8bdbda4a1f96","resolution":{"observed_at":"2026-08-05T14:57:39.441530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-05T11:39:24.061038Z","title":"Agent RL Scaling Law : A gent RL with Spontaneous Code Execution for Mathematical Problem Solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-06T11:30:13.789830Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.061038Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:4de2db1b51c5e37a8bab79b68757f0dcfdd059e8406435eb635b3d28d02c6a6a","observation_id":"8bb1be83-9bc9-4c92-9ae7-b325b209dc4b","resolution":{"observed_at":"2026-08-05T11:39:24.061038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:55.500268Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2509.07969"},"observation_digest":"sha256:5c6b2cf308bfe92ba28a32e1e790a1e030367b52bc83c907dcee3358be91bcfa","observation_id":"7140552f-ec9d-448e-97bf-b4347eeb36f3","resolution":{"observed_at":"2026-05-18T01:17:55.696222Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2510.00568","last_updated":"2026-05-08T11:30:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T06:44:28Z","title":"ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T11:20:02.118579Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2510.00568"},"observation_digest":"sha256:3b341ff4ec693cebba53fbaa1dd1c9a59e295be29c701f4672603e3ea8816122","observation_id":"06159f94-f92e-435e-92db-076035518def","resolution":{"observed_at":"2026-05-18T11:21:18.739433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2511.02734","last_updated":"2026-06-29T03:11:56Z","snapshot_observed_at":"2026-08-04T00:12:30.501128Z","submitted_at":"2025-11-04T16:58:29Z","title":"CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T01:10:50.325484Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2511.02734"},"observation_digest":"sha256:df4f9ee156ade64663e5a3d1be0855e71f93dd162e1470781ef1f589ef465dff","observation_id":"cae61186-19c1-47b3-a9c8-511c1c15a7e5","resolution":{"observed_at":"2026-05-18T01:12:15.363234Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-04T00:12:31.672833Z","title":"Filtered by availability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02734","last_updated":"2026-06-29T03:11:56Z","snapshot_observed_at":"2026-08-04T00:12:30.501128Z","submitted_at":"2025-11-04T16:58:29Z","title":"CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T00:12:31.672833Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2511.02734"},"observation_digest":"sha256:ca4bc0d8ba23a06acab9bc835c57dc105331184a32c8dcfc1ee069381b7926e1","observation_id":"988f592a-a2e1-4807-a6cf-a8a1c1f34491","resolution":{"observed_at":"2026-08-04T00:12:31.672833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-04T06:40:25.051327Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10739","last_updated":"2026-08-03T08:17:50Z","snapshot_observed_at":"2026-08-06T18:35:39.428321Z","submitted_at":"2025-12-11T15:26:28Z","title":"Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T06:40:25.051327Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2512.10739"},"observation_digest":"sha256:e0345311fced5f0644df8d7bda1bf763b08f6a449ad0f88e00d1a438a14282fd","observation_id":"7dcb72e0-1c50-4f99-8526-881157608874","resolution":{"observed_at":"2026-08-04T06:40:25.051327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-03T16:30:39.500962Z","title":"Agent rl scaling law: Agent rl with spontaneous code execution for mathematical problem solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13278","last_updated":"2026-06-05T03:56:56Z","snapshot_observed_at":"2026-08-06T12:37:47.631212Z","submitted_at":"2025-12-15T12:38:04Z","title":"AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T16:30:39.500962Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2512.13278"},"observation_digest":"sha256:dbeda6a2f5c0987d81381ea657cf56bd6f2031d6687c4ff592c40fe5d0480a33","observation_id":"19d6a823-d3f4-43b7-b473-f5f0fbd076c8","resolution":{"observed_at":"2026-08-03T16:30:39.500962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-03T05:25:32.878045Z","title":"Luong, M.-T., Hwang, D., Nguyen, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02405","last_updated":"2026-06-03T06:04:48Z","snapshot_observed_at":"2026-08-04T00:05:15.785462Z","submitted_at":"2026-02-02T18:03:43Z","title":"Making Expert Reasoning Learnable with Self-Distillation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T05:25:32.878045Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2602.02405"},"observation_digest":"sha256:bb108b7ebba69388d971d29c18db6fe9668c1045ebf3fcb3d80218332d9c7831","observation_id":"b980d36e-f6be-41c2-9d23-73eeefa72421","resolution":{"observed_at":"2026-08-03T05:25:32.878045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2603.16876","last_updated":"2026-05-08T08:14:14Z","snapshot_observed_at":"2026-08-02T05:44:39.173956Z","submitted_at":"2026-02-17T12:48:32Z","title":"Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T21:51:10.972744Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2603.16876"},"observation_digest":"sha256:ddec8b55863f84b07df2c42cf0500b9ffac80d8732f67ca6273f10ddfae96e4f","observation_id":"a63896ad-167b-4433-a866-9d3e277308e7","resolution":{"observed_at":"2026-05-15T21:51:40.699405Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-06T14:41:06.876472Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:ba49049cb3b940b3ec7cd0118453b773170eb12ff5cfd42da7cb2060f1fc0ae9","observation_id":"fb5d1019-2f23-4e62-9b69-c82919ee8576","resolution":{"observed_at":"2026-05-11T00:45:50.167268Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:2a064df6f9b4282602ab6c7ec1bfbe8f797fffef1159b78bee4fdb223cf4d55d","observation_id":"b733163e-6620-46d7-815e-d53f3b665ac6","resolution":{"observed_at":"2026-05-12T10:21:29.709212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:f9cfefcb89dd16e5670ac17b592232352f5f05478a4eb95b4994771d6cb473f9","observation_id":"410b48f9-75f4-4f9a-bc58-6b4240c966b2","resolution":{"observed_at":"2026-05-11T22:11:17.002277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:891ede0c61a988b77d4bbbe24a6acc1ace82bb7ccd71b8d4835ab777d7266dcc","observation_id":"fb9f6857-d435-4436-8ddb-fc5d03233f04","resolution":{"observed_at":"2026-05-19T17:02:40.823135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2605.09931","last_updated":"2026-05-11T03:28:43Z","snapshot_observed_at":"2026-08-03T02:44:35.388736Z","submitted_at":"2026-05-11T03:28:43Z","title":"PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:49.165066Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2605.09931"},"observation_digest":"sha256:32f592173c819e47f7f3ada52c5395cdcb776e83a7b89ae638bc1ff167cee6ef","observation_id":"4c808a61-188d-4e55-9e86-c5dd66b4d398","resolution":{"observed_at":"2026-05-12T06:01:23.195048Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2606.11652","last_updated":"2026-06-10T04:30:37Z","snapshot_observed_at":"2026-07-06T23:50:39.386691Z","submitted_at":"2026-06-10T04:30:37Z","title":"IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T10:57:55.875707Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2606.11652"},"observation_digest":"sha256:4cc99c5391e83e1e7f8503037099d01424894ba4dc48f7420747fc2c5f0caa8e","observation_id":"e74073e5-3fd5-4790-919a-d63fab83ad43","resolution":{"observed_at":"2026-07-03T08:17:45.059514Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-05T23:10:47.877661Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T06:39:34.199607Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:b54bd8e356ea0eaea72be7d56fca0aa5c091813b186a35dec438ea617ac00e2f","observation_id":"f13c40ec-3a25-460e-8d45-abf23c9f8f8a","resolution":{"observed_at":"2026-07-03T15:08:33.394598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-03T02:12:21.353101Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-05T23:10:47.877661Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:21.353101Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:90ece30cab411773de8ec342250839991b93b8342f72a5f042292075743bd646","observation_id":"8f44afc6-8f45-4f69-b31c-6d109f32a5c8","resolution":{"observed_at":"2026-08-03T02:12:21.353101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2606.19236","last_updated":"2026-06-17T16:13:42Z","snapshot_observed_at":"2026-07-06T23:54:32.815760Z","submitted_at":"2026-06-17T16:13:42Z","title":"STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T21:09:30.899636Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2606.19236"},"observation_digest":"sha256:cb154646655ebe6e3c1747c6ef33e14c53e1af021c248a0b50ae3af51d7d6f36","observation_id":"41f5a501-6ba6-4947-a74c-a9677759db78","resolution":{"observed_at":"2026-07-04T00:29:16.433527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2505.07773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-07-04T16:29:57.263901Z","title":"Negar Maleki, Balaji Padmanabhan, and Kaushik Dutta","venue":null,"work_id":"1e04bff5-21b0-4db8-89e1-336111a65764","year":2025},"citing_paper":{"arxiv_id":"2606.24233","last_updated":"2026-06-23T07:22:22Z","snapshot_observed_at":"2026-08-02T14:20:11.599861Z","submitted_at":"2026-06-23T07:22:22Z","title":"Latent Visual States for Efficient Multimodal Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T00:38:11.619574Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2606.24233"},"observation_digest":"sha256:a7a00d49f3c4e372cd49224ea914e8be14fb7c8f320deabc131908bd6b4351ab","observation_id":"9dd4607a-78b4-4fc7-8563-ef806333cb08","resolution":{"observed_at":"2026-07-04T16:29:57.265562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-02T14:04:50.220784Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18256","last_updated":"2026-05-14T06:47:20Z","snapshot_observed_at":"2026-08-05T02:13:07.767245Z","submitted_at":"2026-05-14T06:47:20Z","title":"PEARL: Solver-in-the-Loop Interactive Optimization Modeling from Natural Language","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T14:04:50.220784Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2607.18256"},"observation_digest":"sha256:c99bc4c647c944fa42f368dd4115edb4407da5876ff272d939ced17f646daf9c","observation_id":"65a78ef7-3e5b-49be-aeda-577874f59027","resolution":{"observed_at":"2026-08-02T14:04:50.220784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07773/citation-record","integrity":"/paper/2505.07773/integrity","json":"/paper/2505.07773/citation-record.json","paper":"/paper/2505.07773"},"outbound":[],"paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","latest_version":4,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T21:22:40.740091Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2505.07773."}