{"as_of":"2026-08-08T07:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36e2407eb2cf93169db8483ddd94d3ad3770a0d8a55b7e7f5a344337a8b63691","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:01:51.020857Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T17:34:52.336080Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T17:34:57.265122Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2601.15141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15141","snapshot_observed_at":"2026-07-07T02:16:02.718893Z","title":"arXiv preprint arXiv:2601.15141 , year=","venue":null,"work_id":"aecad665-666e-44d4-9d27-423af84bbf69","year":2026},"citing_paper":{"arxiv_id":"2605.22166","last_updated":"2026-05-27T04:34:36Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:36:49Z","title":"Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-22T06:10:26.185447Z"},"links":{"cited_paper":"/paper/2601.15141","citing_paper":"/paper/2605.22166"},"observation_digest":"sha256:28a44f8d9e11bb7b1270fdb4ed85e7390ff21f6e59393014a2d3e8ded40e53e1","observation_id":"5b4f6607-78ba-464c-acf5-87d8e6f19b8d","resolution":{"observed_at":"2026-07-07T02:16:02.718893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2601.15141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15141","snapshot_observed_at":"2026-07-07T02:16:02.718893Z","title":"arXiv preprint arXiv:2601.15141 , year=","venue":null,"work_id":"aecad665-666e-44d4-9d27-423af84bbf69","year":2026},"citing_paper":{"arxiv_id":"2605.22166","last_updated":"2026-05-27T04:34:36Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:36:49Z","title":"Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T17:34:52.336080Z"},"links":{"cited_paper":"/paper/2601.15141","citing_paper":"/paper/2605.22166"},"observation_digest":"sha256:9b3dbabfd810b96b3d82c02f829d792d54e5f11cc95b5e0b821e8ebd672e605e","observation_id":"a0d08ac2-af13-4bb9-9029-08f8a770c63f","resolution":{"observed_at":"2026-07-07T02:16:02.718893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.15141/citation-record","integrity":"/paper/2601.15141/integrity","json":"/paper/2601.15141/citation-record.json","paper":"/paper/2601.15141"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-03T09:01:48.349112Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention.arXiv preprint arXiv:2506.13585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.349112Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:0b1010b4adb0f483557dca2f460edc20d8fe3a76a84f0e3d15c8ee20a860217a","observation_id":"e4ab3d3b-027d-4553-895e-a50d9a704d3c","resolution":{"observed_at":"2026-08-03T09:01:48.349112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-03T09:01:48.654520Z","title":"Retool: Reinforcement learning for strategic tool use in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.654520Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:1131fe5a46a1a696cae35a6f82e16deb9af4ead8640a76862bed1c7b717a538e","observation_id":"e714dde6-3275-43e7-887e-7dc0ec4f00d8","resolution":{"observed_at":"2026-08-03T09:01:48.654520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T09:01:48.820681Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning.arXiv preprint arXiv:2505.24298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.820681Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:c858b2e403333bd4b18a9a7a05f68523ae090bf7a83d44f751d4fbbea3ffd655","observation_id":"bbaf49e3-f50a-4ba9-8bc2-a838fd1b49c6","resolution":{"observed_at":"2026-08-03T09:01:48.820681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-03T09:01:48.960580Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving.arXiv preprint arXiv:2309.17452,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.960580Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:5afdaab49d5b4faec7bdc6eb5fc7ab713aed983c5b334558c2a051b81698be09","observation_id":"180c1cac-d97e-4ecd-8ddb-c91f4bfcbdc5","resolution":{"observed_at":"2026-08-03T09:01:48.960580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-03T09:01:49.068086Z","title":"Skywork open reasoner 1 technical report.arXiv preprint arXiv:2505.22312,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.068086Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:ab1d9e302d6415f3f7c8281f67a154b5314053d7e8e016019cb736e3576a85ef","observation_id":"ed3f8c17-543b-47e7-81eb-eed34f2ded00","resolution":{"observed_at":"2026-08-03T09:01:49.068086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-03T09:01:49.175019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.175019Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:63de641273633180c162c2776f28f8d864bbd035bd03bd9e669ecc2b2c663cef","observation_id":"b5601a98-0cf0-4a9b-ab4b-e18507318bbb","resolution":{"observed_at":"2026-08-03T09:01:49.175019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-03T09:01:49.238425Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.238425Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:a98adff055c88d7686efb9e27ead05358716ef97f3aa69d5509efe692b5ce4e4","observation_id":"11165d18-2286-4f7f-bb6d-bb09a955bfec","resolution":{"observed_at":"2026-08-03T09:01:49.238425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-03T09:01:49.282180Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.282180Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:89424508af26dea956521a82d54cc5c522d5013bbc3d4440456873eae224b2d6","observation_id":"142c089e-79e0-4e3d-89ff-a7f711dcfe86","resolution":{"observed_at":"2026-08-03T09:01:49.282180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-03T09:01:49.333636Z","title":"Training language models to self-correct via reinforcement learning.arXiv preprint arXiv:2409.12917,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.333636Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:78ea1e4dfba82c43e91d98198a95c7015141eb4db5b4b9d4907c6f59caf55dc4","observation_id":"32cf656d-bd86-4703-97a2-04814d70c89e","resolution":{"observed_at":"2026-08-03T09:01:49.333636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-06T06:12:37.171726Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-03T09:01:49.390340Z","title":"Websailor: Navigating super-human reasoning for web agent.arXiv preprint arXiv:2507.02592, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.390340Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:3d09872be4bbe5bfd594fc67206b987f693730c5c297c37d55737833b161402f","observation_id":"4a7dc707-789b-4e8c-920a-913bc6f4425d","resolution":{"observed_at":"2026-08-03T09:01:49.390340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T09:01:49.434593Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.434593Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:9fd319fb1fff7e71a2cf2bb0b94dbe0a4dae0675e83d475b6a2fab30c58106cf","observation_id":"a2ca8d26-6970-4f63-b54e-ed5efa763351","resolution":{"observed_at":"2026-08-03T09:01:49.434593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12255","last_updated":"2022-05-24T17:58:13Z","snapshot_observed_at":"2026-08-07T07:09:50.694532Z","submitted_at":"2022-05-24T17:58:13Z","title":"TALM: Tool Augmented Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12255","snapshot_observed_at":"2026-08-03T09:01:49.506280Z","title":"Aaron Parisi, Yao Zhao, and Noah Fiedel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.506280Z"},"links":{"cited_paper":"/paper/2205.12255","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:85082db2edd51ead0e548ef6cbceff185614a38ae644b18fa14b2cdb3cbe64a7","observation_id":"434df131-b215-494a-a712-39f06697e8c7","resolution":{"observed_at":"2026-08-03T09:01:49.506280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:01:49.563297Z","title":"Defeating the training-inference mismatch via fp16.arXiv preprint arXiv:2510.26788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.563297Z"},"links":{"citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:f0a87444e81c4d1ed1708e9bed02ab855a77ab152daa293629d4a51cfeb88d8d","observation_id":"ab254e2c-0c71-4078-b29c-ad48dd7389c4","resolution":{"observed_at":"2026-08-03T09:01:49.563297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-03T09:01:49.606749Z","title":"Toolrl: Reward is all tool learning needs.arXiv preprint arXiv:2504.13958,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.606749Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:0c3b0bd1a8ad66f0408db2a3df77f92880f66c84cd84cb7910f19a01bc4b5564","observation_id":"7ab0f697-fc9d-4e97-8423-7290699715d7","resolution":{"observed_at":"2026-08-03T09:01:49.606749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-03T09:01:49.682153Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis.arXiv preprint arXiv:2307.16789,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.682153Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:64f5586362584ae14d3487e6599fc2f39f8820efc1094ff4cac461e5ee872e76","observation_id":"de3eaf9c-8587-4984-a51f-5b8bc5bbad01","resolution":{"observed_at":"2026-08-03T09:01:49.682153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:01:49.821208Z","title":"pocoo.org/2025/10/17/code/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.821208Z"},"links":{"citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:2bc4977ca088aef260c6f56db9a302a9a79bd596466c397a589ff74d26fde408","observation_id":"98bcfdf8-07fa-49b6-8372-7ea0a030e119","resolution":{"observed_at":"2026-08-03T09:01:49.821208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-06T20:37:40.736850Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-03T09:01:49.933722Z","title":"rstar2-agent: Agentic reasoning technical report.arXiv preprint arXiv:2508.20722,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.933722Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:16f3aabb9c7b1473f1f93867e6f8f55e0477ed82c708ac85192c1ff224b8a3d2","observation_id":"d2bb13be-c000-42e5-a325-75a7376d07c8","resolution":{"observed_at":"2026-08-03T09:01:49.933722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-03T09:01:50.047393Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.047393Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:54853e8024f41941c18bc98391ab14690b6652bf86204ea81f62b4ee7f11ec9a","observation_id":"5928fef3-ab27-4ab0-9044-f5aa5a6d68eb","resolution":{"observed_at":"2026-08-03T09:01:50.047393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-03T09:01:50.181248Z","title":"Alfworld: Aligning text and embodied environments for interactive learning.arXiv preprint arXiv:2010.03768,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.181248Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:53d700bdc3fadf87798f59f4c0986c5f74fcea1696faab505c31e5c0bf755daf","observation_id":"7323dc5c-2272-404c-9b85-c0a26531bf90","resolution":{"observed_at":"2026-08-03T09:01:50.181248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-03T09:01:50.527848Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.527848Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:4966c95dcb287e6268ee87505138558e9c5671e3207b349d7674126c9d1da054","observation_id":"7d71d9eb-b6e0-40a5-ae43-97b93d7b3733","resolution":{"observed_at":"2026-08-03T09:01:50.527848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-03T09:01:50.680369Z","title":"Zerosearch: Incentivize the search capability of llms without searching.arXiv preprint arXiv:2505.04588,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.680369Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:c787724fc8193dd2c9fb1d047bbc74926bc7a4919ebb07dd8cf7e1525b5eec68","observation_id":"3be6609d-e3ea-4139-b1a0-b2be409ba534","resolution":{"observed_at":"2026-08-03T09:01:50.680369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14151","last_updated":"2024-03-11T03:15:58Z","snapshot_observed_at":"2026-08-02T08:12:03.507982Z","submitted_at":"2024-01-25T13:03:20Z","title":"True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14151","snapshot_observed_at":"2026-08-03T09:01:50.797041Z","title":"True knowledge comes from practice: Aligning llms with embodied environments via reinforcement learning.arXiv preprint arXiv:2401.14151,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.797041Z"},"links":{"cited_paper":"/paper/2401.14151","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:274112f70f62301a508f88f0502407615f6d4fb7a375434152d05eb332e9200b","observation_id":"e7050150-7c8a-43fd-814b-2a4d581f2c0d","resolution":{"observed_at":"2026-08-03T09:01:50.797041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14803","last_updated":"2025-02-21T16:23:59Z","snapshot_observed_at":"2026-07-06T19:36:15.200874Z","submitted_at":"2024-10-18T18:19:56Z","title":"DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14803","snapshot_observed_at":"2026-08-03T09:01:50.824574Z","title":"Otc: Optimal tool calls via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.824574Z"},"links":{"cited_paper":"/paper/2410.14803","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:150a6330cf10a82c964d0fc8d5b9513e74e8f61fa13aa9495e1b994307610b78","observation_id":"bd56bd04-6138-4ab8-bd2f-20d03ae4cd79","resolution":{"observed_at":"2026-08-03T09:01:50.824574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T09:01:50.828166Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.828166Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:df77f74a9cbc5dbfe47f5e02b7f276ed9ca243e4609bf3281f27c98bfcd79b0c","observation_id":"8d8949bb-f3fb-444a-a76b-3f016ae956c1","resolution":{"observed_at":"2026-08-03T09:01:50.828166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T09:01:50.876731Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.876731Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:1b9bd95982e5b5e538aecb1a939db4bf818befb8aafab7b545145e4ef3b39086","observation_id":"e2a7845b-c40d-4353-9094-ae815c6317e5","resolution":{"observed_at":"2026-08-03T09:01:50.876731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:01:51.020857Z","title":"purified","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:51.020857Z"},"links":{"citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:375619b95729d2728d1096d4dcb8e4565c0c1077d12be246047013611df060b6","observation_id":"39931dbd-5fe6-461a-8fa0-ca30c8a38a7b","resolution":{"observed_at":"2026-08-03T09:01:51.020857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-08-05T20:36:54.358831Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-08-03T09:01:50.366780Z","title":"Agentic reasoning and tool integration for llms via reinforcement learning.arXiv preprint arXiv:2505.01441,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:50.366780Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:01bf7e28473e9281cff2be9178eb8e092569522078d548852071330eb4c0abe2","observation_id":"b564bf72-8e55-4866-ab6c-5958a9e452f4","resolution":{"observed_at":"2026-08-03T09:01:50.366780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:01:48.539543Z","title":"Agentic entropy-balanced policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.539543Z"},"links":{"citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:5c236f3051018139a6884c8bbdf633cf95c2aea43b3939f01b9520199539077b","observation_id":"9246615c-e139-4311-addc-cc4d0d27038d","resolution":{"observed_at":"2026-08-03T09:01:48.539543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T09:01:49.015328Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.015328Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:0ac005ac4a80b7a2400674a15018e19de6c916ce41baefc6b8683773b32bc5ea","observation_id":"588c30f6-4fc9-4a2e-9190-e5a041ed1f75","resolution":{"observed_at":"2026-08-03T09:01:49.015328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09078","last_updated":"2025-04-01T12:48:43Z","snapshot_observed_at":"2026-07-06T20:05:46.205005Z","submitted_at":"2024-12-12T09:01:18Z","title":"Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09078","snapshot_observed_at":"2026-08-03T09:01:48.241440Z","title":"Forest-of-thought: Scaling test-time compute for enhancing llm reasoning.arXiv preprint arXiv:2412.09078,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.241440Z"},"links":{"cited_paper":"/paper/2412.09078","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:0db3000bceb943bf5310674c47c8d88b4681b2b14ae2ed837e5c34f947b01c4f","observation_id":"3d2ac0bf-b775-47b6-b766-fa0590755ef2","resolution":{"observed_at":"2026-08-03T09:01:48.241440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-03T09:01:48.458376Z","title":"Program of thoughts prompt- ing: Disentangling computation from reasoning for numerical reasoning tasks.arXiv preprint arXiv:2211.12588,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.458376Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:5ac396aadb1b7db8c8b478a30ed78740f93eeaefee638fe172f5d89966c22383","observation_id":"022a5203-10bc-4fa8-970e-a6c44630f96e","resolution":{"observed_at":"2026-08-03T09:01:48.458376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2601.15141."}