{"as_of":"2026-08-08T08:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b021551de72c5a5630266dac343731a48288d10dcc3348af6925778e3c6526a5","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:07:18.380838Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:00:17.278040Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:16:57.747266Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06980","snapshot_observed_at":"2026-08-03T18:00:17.278040Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.07436","last_updated":"2026-05-31T11:02:36Z","snapshot_observed_at":"2026-08-07T09:13:55.130091Z","submitted_at":"2025-12-08T11:12:39Z","title":"LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:00:17.278040Z"},"links":{"cited_paper":"/paper/2509.06980","citing_paper":"/paper/2512.07436"},"observation_digest":"sha256:914b9bded77ae5c97b99006d731ee61d080c9dc5a79cc89095e22a4a826c3d09","observation_id":"06872784-d724-4494-9912-f89a2a61ba75","resolution":{"observed_at":"2026-08-03T18:00:17.278040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"cited_work":{"arxiv_id":"2509.06980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06980","snapshot_observed_at":"2026-07-02T12:16:57.747266Z","title":"Guanting Dong, Yifei Chen, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Yutao Zhu, Hangyu Mao, Guorui Zhou, Zhicheng Dou, and Ji-Rong Wen","venue":null,"work_id":"16a98cda-65ee-4a06-9e01-9dc2a3bd5185","year":2025},"citing_paper":{"arxiv_id":"2604.07791","last_updated":"2026-04-20T17:11:17Z","snapshot_observed_at":"2026-08-07T23:07:53.953088Z","submitted_at":"2026-04-09T04:38:47Z","title":"SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:26:57.084201Z"},"links":{"cited_paper":"/paper/2509.06980","citing_paper":"/paper/2604.07791"},"observation_digest":"sha256:059f6cf12a24d1659c97ebc4e9305ea3094600187e2209e78c7c201e26dcb491","observation_id":"bddbbd6a-8510-4f17-aa96-93e1f8c41bf3","resolution":{"observed_at":"2026-05-11T06:46:48.471379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"cited_work":{"arxiv_id":"2509.06980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06980","snapshot_observed_at":"2026-07-02T12:16:57.747266Z","title":"Guanting Dong, Yifei Chen, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Yutao Zhu, Hangyu Mao, Guorui Zhou, Zhicheng Dou, and Ji-Rong Wen","venue":null,"work_id":"16a98cda-65ee-4a06-9e01-9dc2a3bd5185","year":2025},"citing_paper":{"arxiv_id":"2606.03273","last_updated":"2026-07-29T14:08:31Z","snapshot_observed_at":"2026-08-02T21:49:04.905427Z","submitted_at":"2026-06-02T07:37:23Z","title":"VistaHop: Benchmarking Long-Horizon Visual DeepSearch","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T10:35:45.449334Z"},"links":{"cited_paper":"/paper/2509.06980","citing_paper":"/paper/2606.03273"},"observation_digest":"sha256:b503079016d2816bd743f8b885fa1cf7665b56c5aa81d952ecea754913cfbb24","observation_id":"1142874d-a039-4f24-b1a4-1b215bfacb85","resolution":{"observed_at":"2026-07-02T02:46:29.261024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06980","snapshot_observed_at":"2026-08-02T12:32:59.871356Z","title":"Hao Chen, Zhexin Hu, Jiajun Chai, Haocheng Yang, Hang He, Xiaohan Wang, Wei Lin, Luhang Wang, Guojun Yin, and Zhuofeng zhao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03273","last_updated":"2026-07-29T14:08:31Z","snapshot_observed_at":"2026-08-02T21:49:04.905427Z","submitted_at":"2026-06-02T07:37:23Z","title":"VistaHop: Benchmarking Long-Horizon Visual DeepSearch","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T12:32:59.871356Z"},"links":{"cited_paper":"/paper/2509.06980","citing_paper":"/paper/2606.03273"},"observation_digest":"sha256:151a929ba5f6636aad75c9e3a81be169240f11fb7a45259cf1cf41c3ec2cc04c","observation_id":"ab8021cf-9c68-49ae-902d-b902bba21c4e","resolution":{"observed_at":"2026-08-02T12:32:59.871356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"cited_work":{"arxiv_id":"2509.06980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06980","snapshot_observed_at":"2026-07-02T12:16:57.747266Z","title":"Guanting Dong, Yifei Chen, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Yutao Zhu, Hangyu Mao, Guorui Zhou, Zhicheng Dou, and Ji-Rong Wen","venue":null,"work_id":"16a98cda-65ee-4a06-9e01-9dc2a3bd5185","year":2025},"citing_paper":{"arxiv_id":"2606.05784","last_updated":"2026-06-04T07:15:43Z","snapshot_observed_at":"2026-08-01T23:01:58.625715Z","submitted_at":"2026-06-04T07:15:43Z","title":"TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:11.638029Z"},"links":{"cited_paper":"/paper/2509.06980","citing_paper":"/paper/2606.05784"},"observation_digest":"sha256:35a9b3683240584f246e8e7a6aca6534147eee92bf412ca1dab731a767682b12","observation_id":"aa4b8412-441a-466e-9849-001daf2e9e7e","resolution":{"observed_at":"2026-07-02T12:16:57.748936Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06980","snapshot_observed_at":"2026-08-02T08:56:36.010374Z","title":"(2025).RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use.CoRR, abs/2509.06980.https://doi.org/10.48550/arXiv.2509.06980","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19395","last_updated":"2026-07-03T05:07:22Z","snapshot_observed_at":"2026-08-07T06:27:15.086404Z","submitted_at":"2026-07-03T05:07:22Z","title":"From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:36.010374Z"},"links":{"cited_paper":"/paper/2509.06980","citing_paper":"/paper/2607.19395"},"observation_digest":"sha256:d4b6647ad3eb9594b5edb018ded06b620537053e6a8308f4edac08d9b01d5335","observation_id":"f73945fa-ece9-4df3-9ccd-86ed0e883e3a","resolution":{"observed_at":"2026-08-02T08:56:36.010374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06980/citation-record","integrity":"/paper/2509.06980/integrity","json":"/paper/2509.06980/citation-record.json","paper":"/paper/2509.06980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:07:18.482967Z","title":"Introducing gpt 5","venue":null,"work_id":"c5a3764f-1839-4418-9b26-a75648e8b66a","year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.350381Z"},"links":{"citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:7f4ad04abdfc3017cbdb34fe80cf92a2de43e31c94769dcd713c153a68354ed3","observation_id":"6c0e1a07-587d-4e63-88ab-a40d9ff44466","resolution":{"observed_at":"2026-08-05T13:07:18.485775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:07:18.474609Z","title":"Agent rl scaling law: Agent rl with spontaneous code execution for mathematical problem solving, 2025","venue":null,"work_id":"85a7a7ae-b344-4c73-bb71-1c5cb157400f","year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.354025Z"},"links":{"citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:dcb8362a7508d68230de7343ff3bc7131abaa4645465c48b5ddb0779c1206c24","observation_id":"4e916ce5-dffe-4c26-8060-2fc22b9698e7","resolution":{"observed_at":"2026-08-05T13:07:18.477442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:07:18.357017Z","title":"Agentic reinforced policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.357017Z"},"links":{"citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:8b6f7467e4323184b14b19f0723ebc2bc19dec2881e523ebbca188f6d2b3cae5","observation_id":"4a0e9739-c96a-49fe-9c7d-c669497d230e","resolution":{"observed_at":"2026-08-05T13:07:18.357017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:07:18.460913Z","title":"Agentic reasoning and tool integration for llms via reinforcement learning, 2025","venue":null,"work_id":"102e7825-e41c-4bea-aa8b-c3c4fad6e100","year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.359940Z"},"links":{"citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:78dfc152300b0564afe73428c859345048cbe51ab56b676194285ccd8fde3c99","observation_id":"3357afd6-2c30-499e-b906-b4dd26856800","resolution":{"observed_at":"2026-08-05T13:07:18.463675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:07:18.362922Z","title":"Search-o1: Agentic search-enhanced large reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.362922Z"},"links":{"citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:ace66e92463e8cc35d57de4fa084a628cd638c96f2f77908d49baa9bee879d15","observation_id":"536182d1-6685-4491-9134-d11dd6372bee","resolution":{"observed_at":"2026-08-05T13:07:18.362922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:07:18.448035Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning, 2025","venue":null,"work_id":"c31786de-3a3a-4dd1-b650-d93ea381a8fa","year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.365922Z"},"links":{"citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:3ada49e4fde48bf8f9ab00953a935eec3f0bfc76ae65e6db378b67015e6f944b","observation_id":"525d9313-2543-4522-9255-460b0002a9f0","resolution":{"observed_at":"2026-08-05T13:07:18.450757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:07:18.439474Z","title":"Mmsearch-r1: Incentivizing lmms to search, 2025","venue":null,"work_id":"955a4f53-f032-4415-be25-beb902909aa5","year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.368961Z"},"links":{"citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:f6d4e8857b12037df8fd8382c4020605fa0375108b4ea3c4d6e747489fc10603","observation_id":"8bdf368b-a736-4ff5-b227-6c47ad6c23f7","resolution":{"observed_at":"2026-08-05T13:07:18.442344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:07:18.428844Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments, 2025","venue":null,"work_id":"676aa216-4bfb-4961-aaaf-e1e9cdd956ac","year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.372033Z"},"links":{"citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:cea6a458665772bc7ddaf23bef12b7c4802ac41a7579aeaf43ee29b5b8ca1522","observation_id":"c4d907dc-e03e-42c8-a09e-407c739803a9","resolution":{"observed_at":"2026-08-05T13:07:18.433534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20625","last_updated":"2024-05-31T05:23:35Z","snapshot_observed_at":"2026-07-06T18:23:05.893052Z","submitted_at":"2024-05-31T05:23:35Z","title":"Robust Planning with LLM-Modulo Framework: Case Study in Travel Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20625","snapshot_observed_at":"2026-08-05T13:07:18.374868Z","title":"Robust planning with llm-modulo framework: Case study in travel planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.374868Z"},"links":{"cited_paper":"/paper/2405.20625","citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:67c66fcbfce7bc8283798d7550c8b168bb7209a109087a93c8ff09356f988415","observation_id":"b161d047-2c1b-404d-8a62-0ce2e56eafd8","resolution":{"observed_at":"2026-08-05T13:07:18.374868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20508","last_updated":"2025-02-27T20:33:28Z","snapshot_observed_at":"2026-08-07T17:41:39.354491Z","submitted_at":"2025-02-27T20:33:28Z","title":"TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20508","snapshot_observed_at":"2026-08-05T13:07:18.377992Z","title":"Tripcraft: A benchmark for spatio-temporally fine grained travel planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.377992Z"},"links":{"cited_paper":"/paper/2502.20508","citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:60d5f0b40860032778028ed1d5676deac223ed32353e6ec9cc8bc6277edd6a3b","observation_id":"8f37fafe-1ae4-47f6-9956-5a28792d3deb","resolution":{"observed_at":"2026-08-05T13:07:18.377992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T13:07:18.380838Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:07:18.380838Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.06980"},"observation_digest":"sha256:f9235ac1a8cc39ff267d006e05bc886968e0996858b35fab67d26303f86e4d12","observation_id":"17e17ad6-cbbf-4845-a144-4485a5f87b7a","resolution":{"observed_at":"2026-08-05T13:07:18.380838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06980","last_updated":"2025-08-31T16:47:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T13:07:14.010109Z","submitted_at":"2025-08-31T16:47:31Z","title":"RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 6 inbound Pith citation observations for arXiv:2509.06980."}