{"as_of":"2026-08-06T15:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd5a3d961c92db392acb928d60f1049c28dc6b726a4a594c1146ef9af6fa0da3","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:17:55.180539Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:16:44.178281Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T12:30:59.971543Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2511.00413","last_updated":"2026-04-23T16:13:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-01T05:56:49Z","title":"Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T02:04:46.559881Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2511.00413"},"observation_digest":"sha256:15b752fefd4de300334e53072d8271724fd0c450167b6cad2daa73dabc18dfe7","observation_id":"4aa540f4-64bf-464e-bd6b-1700fed9f2f3","resolution":{"observed_at":"2026-05-18T02:05:39.048068Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-03T11:08:09.429860Z","title":"Qiu, and Yuqing Yang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07376","last_updated":"2026-07-06T09:21:40Z","snapshot_observed_at":"2026-08-05T07:22:32.174869Z","submitted_at":"2026-01-12T09:57:46Z","title":"OpenTinker: Separating Concerns in Agentic Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:09.429860Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2601.07376"},"observation_digest":"sha256:9bbbab78818ef4707d02c46997375f80762abf3c994ad490bc8df7c509f5a003","observation_id":"fa5821be-347f-433a-8119-8b008824ceb0","resolution":{"observed_at":"2026-08-03T11:08:09.429860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2603.24935","last_updated":"2026-04-07T10:20:22Z","snapshot_observed_at":"2026-08-06T10:57:09.113964Z","submitted_at":"2026-03-26T01:56:01Z","title":"SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T01:06:42.421062Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2603.24935"},"observation_digest":"sha256:87014e6c88d9541818efcc46610ab1d52c5e3427f7edc0e12bb8db479b7295d5","observation_id":"b9829e51-f9e8-4ccf-a841-be6d5c3d5a0e","resolution":{"observed_at":"2026-05-15T01:08:25.731016Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2604.04853","last_updated":"2026-04-06T16:57:06Z","snapshot_observed_at":"2026-08-06T00:28:02.697922Z","submitted_at":"2026-04-06T16:57:06Z","title":"MemMachine: A Ground-Truth-Preserving Memory System for Personalized AI Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T20:21:15.014067Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2604.04853"},"observation_digest":"sha256:64275cbb1df1b82897d68807ec328d6f4a19701f9e242565c0416bcdab3c297a","observation_id":"40aa32a2-bd46-4817-b029-5e0d63017c47","resolution":{"observed_at":"2026-05-10T22:00:48.598498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2604.09459","last_updated":"2026-04-13T12:08:22Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:17:44Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:36.341574Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2604.09459"},"observation_digest":"sha256:e8dbe2e9bf80b9b4b795f9cb6b264ba39c7273971f1f2dad848980d342d04724","observation_id":"e1aa28de-4ca5-4970-8924-f6dabe9fa547","resolution":{"observed_at":"2026-05-11T07:30:58.434148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2604.18133","last_updated":"2026-04-20T12:00:31Z","snapshot_observed_at":"2026-08-03T09:21:05.928583Z","submitted_at":"2026-04-20T12:00:31Z","title":"Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T04:31:28.242097Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2604.18133"},"observation_digest":"sha256:a4343eff78bd3a14bf769a2dfe76b3b79a4460b36a1ee3ee5015771d35f392e4","observation_id":"99b6cb2c-e8b0-427c-9e6f-a91abd6a64e5","resolution":{"observed_at":"2026-05-11T11:51:03.991797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2604.18401","last_updated":"2026-06-21T13:04:23Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T15:22:39Z","title":"StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T04:26:59.781416Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2604.18401"},"observation_digest":"sha256:c9f70543de490cf1a4edf27bb3d446026b0de1793a9a205cf2f3233f657db3ca","observation_id":"2ef144ab-c294-4f08-a830-35a4421634c7","resolution":{"observed_at":"2026-05-11T11:56:29.833782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2604.18401","last_updated":"2026-06-21T13:04:23Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T15:22:39Z","title":"StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-05T12:23:00.487399Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2604.18401"},"observation_digest":"sha256:4c411ab3f191ed8b5c2cfc3e838a7822322559219b1a52546907cfa2d7271ebe","observation_id":"2a368e2a-dbf3-432e-b6df-8c406dd9bcd5","resolution":{"observed_at":"2026-07-05T12:30:59.972779Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2604.27840","last_updated":"2026-05-04T08:56:40Z","snapshot_observed_at":"2026-08-02T19:56:23.229430Z","submitted_at":"2026-04-30T13:24:42Z","title":"CastFlow: Learning Role-Specialized Agentic Workflows for Time Series Forecasting","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-07T05:45:13.969847Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2604.27840"},"observation_digest":"sha256:2925ab3d58386e5283f94c3ccaeef1404f121750e3c0275da418a0e5be863b42","observation_id":"bd334dc2-348c-456d-ad07-b0cc26576527","resolution":{"observed_at":"2026-05-12T10:31:30.367492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2605.02801","last_updated":"2026-05-04T16:42:18Z","snapshot_observed_at":"2026-07-06T23:15:51.008483Z","submitted_at":"2026-05-04T16:42:18Z","title":"Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T18:44:27.685266Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2605.02801"},"observation_digest":"sha256:1329fb7d1086e8f1dc77bb2c109a7b506f164f24baed20d0e2268fc61207baff","observation_id":"e22e45f8-ad69-479a-af6a-706478cd2344","resolution":{"observed_at":"2026-05-09T06:15:37.848107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-08T10:12:58.421050Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:0b32cdb64368280bd72c56ce7921f8008809c337b0f2abe90231dc2307313a6e","observation_id":"56c63d53-8a28-4005-8cb0-a887fe0fa735","resolution":{"observed_at":"2026-05-11T20:06:18.481920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:48.838028Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:5b1fbf14c6da62e805677905213ebabba3ddb39893c48eb900cc9b24bb4060c2","observation_id":"8cfc8208-9155-479e-a9b6-219b10890a65","resolution":{"observed_at":"2026-05-11T05:00:54.754916Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2605.06642","last_updated":"2026-05-07T17:51:16Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:51:16Z","title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-08T09:59:48.604813Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2605.06642"},"observation_digest":"sha256:35a5bfff22b47d0fc8d90874b7d35f1a8e75d9aa88b1709bae8dd5bc8ae5c79c","observation_id":"91af1536-3d0e-42d9-97a2-ecbd6d1ba5e5","resolution":{"observed_at":"2026-05-11T20:11:12.228122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2605.22781","last_updated":"2026-06-08T12:58:55Z","snapshot_observed_at":"2026-08-03T17:11:27.377640Z","submitted_at":"2026-05-21T17:36:17Z","title":"DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T02:44:50.866913Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2605.22781"},"observation_digest":"sha256:5719434d033e8a425f95d54cdc410270be9909ce27796a5c023b1c888f20d6ad","observation_id":"f30601ee-e4e2-44dd-b7b2-4f06a82946c9","resolution":{"observed_at":"2026-05-22T02:45:57.284002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2605.22781","last_updated":"2026-06-08T12:58:55Z","snapshot_observed_at":"2026-08-03T17:11:27.377640Z","submitted_at":"2026-05-21T17:36:17Z","title":"DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T16:15:24.370887Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2605.22781"},"observation_digest":"sha256:94da0ac957ec3125f507f2c973c8a2f16df88979d2cd5632f4b1c57e9b460345","observation_id":"8f812e7a-e40b-40f6-b5d4-41bd368033b1","resolution":{"observed_at":"2026-06-30T16:24:57.148274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2606.04484","last_updated":"2026-07-21T12:35:46Z","snapshot_observed_at":"2026-08-02T12:27:06.509399Z","submitted_at":"2026-06-03T06:02:52Z","title":"AgentJet: A Distributed Swarm Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T06:26:35.100859Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2606.04484"},"observation_digest":"sha256:3016a00e077acce81fa50844abde7c4428d029d9617fec48d8e46ec49a8c2192","observation_id":"db17482e-7863-442d-8f95-c5dea6eb5308","resolution":{"observed_at":"2026-07-02T07:56:47.903485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-02T12:27:08.761678Z","title":"Qiu, and Yuqing Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04484","last_updated":"2026-07-21T12:35:46Z","snapshot_observed_at":"2026-08-02T12:27:06.509399Z","submitted_at":"2026-06-03T06:02:52Z","title":"AgentJet: A Distributed Swarm Training Framework for Agentic Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T12:27:08.761678Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2606.04484"},"observation_digest":"sha256:9c4f1ec56149fc5bfa77686d6ca89c68f4fa6c1f9443941ef4c80fe30979c313","observation_id":"6404d1d6-c93a-4ae6-928f-3f3f9580f487","resolution":{"observed_at":"2026-08-02T12:27:08.761678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2606.05874","last_updated":"2026-06-04T08:47:15Z","snapshot_observed_at":"2026-08-05T10:44:25.117191Z","submitted_at":"2026-06-04T08:47:15Z","title":"Evaluating Stochastic Collapse and Implicit Bias in Multimodal Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T01:29:55.885301Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2606.05874"},"observation_digest":"sha256:7ae1263b67c461dcdd84c0fb7313c11696bd3c59efcbbfa6a0d2e20c5b7e5f3b","observation_id":"cda8438b-7141-4fa0-b3cd-50c150ce4b38","resolution":{"observed_at":"2026-07-02T13:16:58.419557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2606.09138","last_updated":"2026-06-08T07:35:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T07:35:18Z","title":"Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T17:28:58.574865Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2606.09138"},"observation_digest":"sha256:0df809413730ec80558c61dc501c8b30c746b833e2d348f6d0a0115e0adc9c97","observation_id":"47db7415-e90d-4548-91be-a657816baa20","resolution":{"observed_at":"2026-07-03T00:07:28.221077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2606.22995","last_updated":"2026-06-22T08:12:47Z","snapshot_observed_at":"2026-07-06T23:57:47.047975Z","submitted_at":"2026-06-22T08:12:47Z","title":"Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T08:44:23.085858Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2606.22995"},"observation_digest":"sha256:c1521abbb1c1690e030edcd7ad12182c93720b9a3a5390aaee302fc06c50d750","observation_id":"6bffb571-cdb1-4ee8-a8dd-004942714109","resolution":{"observed_at":"2026-07-04T10:29:45.775369Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2606.25161","last_updated":"2026-06-23T20:49:28Z","snapshot_observed_at":"2026-08-02T17:53:29.243998Z","submitted_at":"2026-06-23T20:49:28Z","title":"TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T22:51:47.190143Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2606.25161"},"observation_digest":"sha256:e833fe041cb45534765e277b16317b8ab1463b3f600115e329d06d068728da16","observation_id":"70793426-beb0-4a6a-bde9-e15c730f2ab3","resolution":{"observed_at":"2026-07-04T18:30:01.311829Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-05T12:30:59.971543Z","title":"Qiu, and Yuqing Yang","venue":"cs.AI","work_id":"a4d7f3cc-516f-4c31-922b-2230a6afd5c7","year":2025},"citing_paper":{"arxiv_id":"2606.25451","last_updated":"2026-06-24T06:26:34Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:26:34Z","title":"Learning with a Single Rollout via Monte Carlo Pass@k Critic","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-25T20:53:10.016447Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2606.25451"},"observation_digest":"sha256:2e9f591481f94c73fa539a7d96516fc79e30083fa0bd3d992bc761efa1a69965","observation_id":"86a49177-1e79-492c-a7f5-410e2516b81c","resolution":{"observed_at":"2026-07-04T20:00:08.370844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-02T01:10:21.137852Z","title":"and Yang, Yuqing , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-05T21:32:12.968039Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.137852Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:97ac691047b4cfc33bb387a07aaaa5727fc668643fc2998eb076081e6659c64a","observation_id":"617abad4-a511-40ae-8edb-cad265016600","resolution":{"observed_at":"2026-08-02T01:10:21.137852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-01T09:49:29.589477Z","title":"Qiu, and Yuqing Yang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-06T08:38:08.188489Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:29.589477Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:ec35524f08ef4a330e7ec216e58c48a44801a7139acdc4f4a4e447336b95eeca","observation_id":"10f4918a-182a-47d9-bff4-716a6e3ab1ac","resolution":{"observed_at":"2026-08-01T09:49:29.589477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-07-31T22:51:47.527608Z","title":"arXiv preprint arXiv:2508.03680 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27937","last_updated":"2026-07-30T09:47:58Z","snapshot_observed_at":"2026-08-06T10:28:04.843430Z","submitted_at":"2026-07-30T09:47:58Z","title":"From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T22:51:47.527608Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2607.27937"},"observation_digest":"sha256:e7efab21052ffe98ca9a015c6577062ddf10b8073e91587d130b7a775199e831","observation_id":"09a285f4-5ea3-4534-88cd-dc32d861ebc8","resolution":{"observed_at":"2026-07-31T22:51:47.527608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-03T03:15:14.237509Z","title":"URLhttps://arxiv.org/abs/2508.03680","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29626","last_updated":"2026-07-31T16:58:00Z","snapshot_observed_at":"2026-08-05T23:16:09.400110Z","submitted_at":"2026-07-31T16:58:00Z","title":"AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:14.237509Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2607.29626"},"observation_digest":"sha256:8384ef554991d2d1698703a7262014c63ff9d162f0f381f2c3b5b9e61292e036","observation_id":"25524da6-685d-4160-bd87-83ce41fad8c3","resolution":{"observed_at":"2026-08-03T03:15:14.237509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-04T09:44:32.258349Z","title":"URL https://arxiv.org/abs/2508.03680","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02302","last_updated":"2026-08-03T14:27:58Z","snapshot_observed_at":"2026-08-06T14:26:21.537963Z","submitted_at":"2026-08-03T14:27:58Z","title":"Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:32.258349Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2608.02302"},"observation_digest":"sha256:4c512c09cc764ae004872ba0f145ac0155eca000acd72d70503fdadb20274567","observation_id":"5deec36a-4a7c-410a-955a-0cd152744073","resolution":{"observed_at":"2026-08-04T09:44:32.258349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-05T23:15:50.795278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-06T14:31:27.311775Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.795278Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:d48363217dd5caf4a84b1d87730abbc3f6d9c4a58969a3b58ef4d46492145117","observation_id":"525c4e31-9b8a-4ab2-8e01-d00e5e1783af","resolution":{"observed_at":"2026-08-05T23:15:50.795278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-06T04:16:44.178281Z","title":"and Yang, Yuqing , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05144","last_updated":"2026-08-05T17:58:58Z","snapshot_observed_at":"2026-08-06T14:40:27.759569Z","submitted_at":"2026-08-05T17:58:58Z","title":"Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T04:16:44.178281Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2608.05144"},"observation_digest":"sha256:240b9a2422571b7bd72f2a5acc090cb5afedcf948152266e4093594d0c4dec6f","observation_id":"626ed6e3-f6cf-46fa-98f5-9f5becf81f10","resolution":{"observed_at":"2026-08-06T04:16:44.178281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.03680/citation-record","integrity":"/paper/2508.03680/integrity","json":"/paper/2508.03680/citation-record.json","paper":"/paper/2508.03680"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-06T04:17:54.224738Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.224738Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:215767b7128fe4bb1b9fba6add4b007524d75b70316aa0afa6d7ffed76c39866","observation_id":"19b88973-fc7d-4669-8f19-5fec698cc059","resolution":{"observed_at":"2026-08-06T04:17:54.224738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-06T04:17:54.271607Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.271607Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:08e15c9e83fc7412e85fb6421605e58ef2218b3941cf8fe14a2ae6ba55f72572","observation_id":"35631d70-40c8-4909-b2ad-40ae625c4f0c","resolution":{"observed_at":"2026-08-06T04:17:54.271607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:17:56.362769Z","title":"Calc-x and calcformers: Empow- ering arithmetical chain-of-thought through interaction with symbolic systems","venue":null,"work_id":"5aaaafec-68e6-477c-813d-40e911657e7e","year":2023},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.415024Z"},"links":{"citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:601540b12bba92d13e02073ba4b00ddb0b30688f220989dfe746fd83762efde0","observation_id":"eb7bc0da-7fcf-4656-8f12-123cd6233a1d","resolution":{"observed_at":"2026-08-06T04:17:56.478147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15017","last_updated":"2023-10-23T15:23:22Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:58:20Z","title":"Calc-X and Calcformers: Empowering Arithmetical Chain-of-Thought through Interaction with Symbolic Systems","version":2},"cited_work":{"arxiv_id":"2305.15017","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15017","snapshot_observed_at":"2026-08-06T04:17:55.608767Z","title":"Calc-X and Calcformers: Empowering Arithmetical Chain-of-Thought through Interaction with Symbolic Systems","venue":"cs.LG","work_id":"41d9e6e4-7f9f-49ee-959b-a4bac0394a25","year":2023},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.513604Z"},"links":{"cited_paper":"/paper/2305.15017","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:99290d14bd6a7cf02d5b996e9aa39bb083482562a4ea2ca16b544c916f12bd0e","observation_id":"3600006b-13e1-436f-8fc0-7afee1e242d4","resolution":{"observed_at":"2026-08-06T04:17:55.692183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02977","last_updated":"2025-12-03T03:33:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:59:41Z","title":"Large Language Model-Based Agents for Software Engineering: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02977","snapshot_observed_at":"2026-08-06T04:17:54.598374Z","title":"URL https://www.usenix.org/conference/osdi24/presentation/lin-chaofan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.598374Z"},"links":{"cited_paper":"/paper/2409.02977","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:290c8a7ee8c9b8ef9379bd176df504d1e725d840171f0d3fb88455bab0de5240","observation_id":"c207ee94-d154-46b3-91a2-e81ff202fb9f","resolution":{"observed_at":"2026-08-06T04:17:54.598374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:17:56.111113Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"565f82be-f7d4-4387-9d8d-5d75577a9792","year":2024},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.665686Z"},"links":{"citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:e82bb28fffa1cadbe7497ffb27079bca765a20be6782a354631d972e51639631","observation_id":"97ccb916-e052-42f8-adcc-95288bfa8d99","resolution":{"observed_at":"2026-08-06T04:17:56.250159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T04:17:54.814258Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.814258Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:902cf617b19c431e4d977bb4b41e5e1e2bb087196568ad130f9b4797c3cb44be","observation_id":"6447b7ca-4b75-4386-ac06-caad8b5ded18","resolution":{"observed_at":"2026-08-06T04:17:54.814258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T04:17:54.881176Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.881176Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:6c90a11ca2ae3d7e1a7f7787b27b8627e4927a3c02f6f14abb045fc0dcf78024","observation_id":"1f254891-bc51-4c60-ab8e-12a631f3dc87","resolution":{"observed_at":"2026-08-06T04:17:54.881176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T04:17:54.950655Z","title":"Kimi Team, Angang Du, Bofei Gao, Bowei Xing, Changjiu Jiang, Cheng Chen, Cheng Li, Chenjun Xiao, Chenzhuang Du, Chonghua Liao, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.950655Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:5ebdf4e30bb2543c44e7da69097264fc99a8252fd4f2c8c904c79c8fd0792a8e","observation_id":"e55033c0-d6f1-4607-a3ef-ab798e4e3160","resolution":{"observed_at":"2026-08-06T04:17:54.950655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:17:55.830491Z","title":"Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task","venue":null,"work_id":"6f03c70c-a9ee-4bb0-ba98-37c1800560ff","year":2018},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:55.091229Z"},"links":{"citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:179630e4cb26d733d6b90d263da17c91c8f8fdc9c9b51e04897247e722a86228","observation_id":"29adce2f-2fdc-416d-b994-ef7f08d0cc62","resolution":{"observed_at":"2026-08-06T04:17:55.985289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-07-06T21:37:56.477028Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-06T04:17:55.008086Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:55.008086Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:1c4eea8fb9ee7f43f87044cea90174a38c40bee3a95bda342bce927a3feaadc4","observation_id":"897f391b-d021-49bd-bf3a-e1519725b756","resolution":{"observed_at":"2026-08-06T04:17:55.008086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:17:55.180539Z","title":"Retrieve anything to augment large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:55.180539Z"},"links":{"citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:3b663edc24bd0c122da8654a0ca6fccde6b59f17dd0d4423c399e96f8eaa61c1","observation_id":"bc800de8-0a7e-4cd1-8c98-84dda9e21b25","resolution":{"observed_at":"2026-08-06T04:17:55.180539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:17:54.723625Z","title":"Trinity-rft: A general-purpose and unified framework for reinforcement fine-tuning of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.723625Z"},"links":{"citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:671f47594d3c832ccd68bd5b0f76af75a20afa6509002734ee04390a97b569c2","observation_id":"15852412-3112-4d4b-ae06-a47236665171","resolution":{"observed_at":"2026-08-06T04:17:54.723625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-06T04:17:54.038821Z","title":"Retool: Reinforcement learning for strategic tool use in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.038821Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:d91894abc0a42050d88c5435946761306ae6203cb03ae85618936fc13b61efb0","observation_id":"4054d7c1-8bf6-4ee3-a37e-43c1898056da","resolution":{"observed_at":"2026-08-06T04:17:54.038821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T04:17:54.349118Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.349118Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:fc7a50320a6856a567f959b6f1561b3c46ae7fdecb7dc6088430ad4edb92423d","observation_id":"cfd184d4-2551-4b11-a715-df97c12b1297","resolution":{"observed_at":"2026-08-06T04:17:54.349118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-06T04:17:54.142833Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.142833Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:b4ce3071fa34c8f45881cd0f742e36b4eccba0a64ceaedeaa84cd88890b0426d","observation_id":"c27dc36d-5ebe-46fa-ab14-4e34213b8488","resolution":{"observed_at":"2026-08-06T04:17:54.142833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 29 inbound Pith citation observations for arXiv:2508.03680."}