Pith. sign in

Paper Citation Record · LEDGER

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents

As of 22 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 6 inbound Pith citation observations for arXiv:2509.06283.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.06283 v2

Coverage vector

measured 53 of 53 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T23:55:38.734605Z

measured 59 of 59 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 6 of 6 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T08:48:42.025933Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-05T15:11:10.856386Z

Reference resolution

53 of 53 outbound references displayed

  • verified exact1
  • verified fuzzy11
  • unresolved41
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 556dd4b0-eeac-47b2-b240-88876f1a0a2b · outbound

This paper cites gpt-oss-120b & gpt-oss-20b Model Card.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents gpt-oss-120b & gpt-oss-20b Model Card

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.706182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.706182Z digest=sha256:0f77898a5c07cb484bf58353484f87f872063598338cb78eafb101dd5693353e

Observation 2304a2d2-ab78-47ad-9972-0abd7ef86a24 · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.711661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.711661Z digest=sha256:69d53c001f694776dac14a2eeef6e61a8bcd158a6a44c9b40e3bc880d51b1b1d

Observation 9c4b1357-78e4-46a9-9a29-58a20e0c6eaa · outbound

This paper cites Open Deep Search: Democratizing Search with Open-source Reasoning Agents.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Open Deep Search: Democratizing Search with Open-source Reasoning Agents

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.716627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.716627Z digest=sha256:15d1a8d876eaad93eb497cc6d6b99cabae2f8092951f6ad2394f7186e98d94cd

Observation 4f2ca88e-e8ab-4202-9231-a75aaafd9225 · outbound

This paper cites A survey on rag with llms.Procedia computer science, 246:3781–3790, 2024.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents A survey on rag with llms.Procedia computer science, 246:3781–3790, 2024

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.721667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.721667Z digest=sha256:0696422821e49bc2785152eb2aa4fea13e16fdf4b01abd2058d053be94c25eed

Observation bdec6b1e-b6f1-49c5-82ff-c03aa979db81 · outbound

This paper cites Mindsearch: Mimicking human minds elicits deep ai searcher.arXiv preprint arXiv:2407.20183, 2024.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Mindsearch: Mimicking human minds elicits deep ai searcher.arXiv preprint arXiv:2407.20183, 2024

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.726230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.726230Z digest=sha256:132203bf09b646fd5aab4ed84fe0bbe05c9774ceb6b305111b2472685f617f94

Observation 9cdfc913-c152-4621-9cd7-ffd49e7a17a2 · outbound

This paper cites Benchmarking Deep Search over Heterogeneous Enterprise Data.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Benchmarking Deep Search over Heterogeneous Enterprise Data

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.731166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.731166Z digest=sha256:0e4c0798707390bc067d255f7a6e6c340e999a126db98897e2975b9805735ebd

Observation bb1f8fa2-b117-40a7-9948-593371d358ff · outbound

This paper cites Agentic Reinforced Policy Optimization.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Agentic Reinforced Policy Optimization

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.736756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.736756Z digest=sha256:2413c84b1610904e3178eb517f379594e04e4075ab9adc7dcfb12015f494fd45

Observation 4c532bec-d396-4af8-bca5-184e04e40f98 · outbound

This paper cites ReTool: Reinforcement Learning for Strategic Tool Use in LLMs.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents ReTool: Reinforcement Learning for Strategic Tool Use in LLMs

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.741635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.741635Z digest=sha256:25c673fad1b1c18bdb4275e14b6c5cc31179a3567303201d764e2dbb90c86964

Observation 1aecedd8-ebcb-427e-81ae-6d6372bca32f · outbound

This paper cites Try deep research and our new experimental model in gemini, your ai assistant.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Try deep research and our new experimental model in gemini, your ai assistant

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.707988Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:37.746195Z digest=sha256:ba33ac605ed434c4b508aa821e4554e27c634f87949c730b1fa973386e5284af

Observation 9fcbe86e-28a9-4ce7-ad97-b1ade57395c9 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.750975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.750975Z digest=sha256:2c7cb83d9ef5da37862b34e01656886566bebb516330630642aaca71a39b0ea7

Observation 1bc4a0e3-83bf-42e1-995e-9ea455e02077 · outbound

This paper cites Search-Time Data Contamination.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Search-Time Data Contamination

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.759521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.759521Z digest=sha256:a6fe9daf3274a421247bf8f2eac49ca70394bf097170c3c589f3220e99391e8c

Observation 47f0b15b-15eb-460c-bf54-2dae793b1fdc · outbound

This paper cites Constructing a multi-hop QA dataset for comprehensive evaluation of reasoning steps.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Constructing a multi-hop QA dataset for comprehensive evaluation of reasoning steps

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.772619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.772619Z digest=sha256:284033dfb5d68091c8c937526ac9dbb229b410af1e0ef7035cb394c9bb09af1f

Observation 4dacb85f-9cdc-4029-913b-85458931071d · outbound

This paper cites Characterizing Deep Research: A Benchmark and Formal Definition.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Characterizing Deep Research: A Benchmark and Formal Definition

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.784908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.784908Z digest=sha256:ec7452ec0ba643e8e2edc45e9e2599b006b6b4436d69e2f96793355decbc6218

Observation 5f4610cf-c874-4f1b-bdf1-02dddb23c70d · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.798835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.798835Z digest=sha256:b68fb657d46f94ae690c854d485f5fa25ad21295c19391b2a919f5eec111a61e

Observation 11cd8f17-d9da-4a14-93b0-28399a1e1dfe · outbound

This paper cites Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.813481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.813481Z digest=sha256:34cb1da7737506ce3f1c03aaab289b679e99960737741ba69d1ecc39d9c0ca95

Observation f7dc80c9-2381-4982-a1c3-f58a47d0d2be · outbound

This paper cites Open deep research github.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Open deep research github

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.692679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:37.827017Z digest=sha256:0acfec0822bba73418551220f9dd439abf5112c2c4fc24ec489788e34b3c2f0e

Observation b0957b8b-f8e2-456b-8c82-272e135b53da · outbound

This paper cites WebSailor: Navigating Super-human Reasoning for Web Agent.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents WebSailor: Navigating Super-human Reasoning for Web Agent

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.844139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.844139Z digest=sha256:7be030a5f103d18548bc001fa2d4f47444a0328a3fc3e35c87d395207082b9b4

Observation dcdc812e-5f22-4df7-b1b8-81b57d114aa0 · outbound

This paper cites Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.907213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.907213Z digest=sha256:3b6c02654256daaea8d50c9347cadf480daffecd5444d71739398433964f3006

Observation 2ae1fb89-5328-4d81-bb50-0f1726832d97 · outbound

This paper cites Search-o1: Agentic Search-Enhanced Large Reasoning Models.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Search-o1: Agentic Search-Enhanced Large Reasoning Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:37.973823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:37.973823Z digest=sha256:0128d3a5a4e0dbb7db00fba83031aa1eb3285c16136d81f64c6da74eb723275c

Observation 27ec85fa-eb31-4f0e-a535-a8228a55399a · outbound

This paper cites WebThinker: Empowering Large Reasoning Models with Deep Research Capability.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents WebThinker: Empowering Large Reasoning Models with Deep Research Capability

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.035851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.035851Z digest=sha256:38f74059daaee331a5f5ccbd245cc4e74bd57ee613428ac5620442d5640016e1

Observation e44d5100-5f37-478c-8a4d-474f38a0c806 · outbound

This paper cites ToRL: Scaling Tool-Integrated RL.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents ToRL: Scaling Tool-Integrated RL

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.101554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.101554Z digest=sha256:6d79257bbcf4ee299ef654c9ddf72809535390058ac1c3481fc0b7555ca343e5

Observation 18f1d8da-4204-4d18-a5a1-75c1911ed184 · outbound

This paper cites Openmanus: An open-source framework for building general ai agents, 2025.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Openmanus: An open-source framework for building general ai agents, 2025

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.174005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.174005Z digest=sha256:4bcf89e0aef1af339186ba7f1efb83ae7354f61d11b11bd1d58c8fd6e6457a57

Observation 201cd6c1-3ec3-4890-b5e3-f4830eae074a · outbound

This paper cites APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.242749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.242749Z digest=sha256:5af1f15d58e49255c8db33eb1c5591bacb3935bab51080176e0825c661a99fe5

Observation b96554e1-13b7-4d1d-a4c2-1b88cbf1d2e1 · outbound

This paper cites Gaia: a benchmark for general ai assistants.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Gaia: a benchmark for general ai assistants

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.372992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.372992Z digest=sha256:162fa62206caf1c1e6ba333a9cc7efe20d33edbcc6986c7db07c42fd38ab3e21

Observation 08a0fcf2-eee7-420a-a8e9-f4518f11d5e9 · outbound

This paper cites Miromind open deep research.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Miromind open deep research

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.663862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.439572Z digest=sha256:2c5318756e08d28e82391b5a20a0a6dc58fbbee371b58205a9f0757b7fc7dbc8

Observation d193feae-a9c3-4020-b05e-9089673fefd0 · outbound

This paper cites Kimi-researcher: End-to-end rl training for emerging agentic capabilities.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Kimi-researcher: End-to-end rl training for emerging agentic capabilities

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.647652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.511229Z digest=sha256:6d7594f22d454432ee11c68c6f135c4613632654c7b4acecc289627992e10e80

Observation 8c76193a-9380-4d52-96be-cc508fc38800 · outbound

This paper cites SFR-RAG: Towards Contextually Faithful LLMs.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents SFR-RAG: Towards Contextually Faithful LLMs

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.553494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.553494Z digest=sha256:ab0a58327a3a77241c258c48cd940a475206429c8d88c1044b2858603368b336

Observation 0a6288bf-87fe-4713-b27b-e4e87c40e12d · outbound

This paper cites Gpt-5 system card.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Gpt-5 system card

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.629046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.619294Z digest=sha256:ab5dfa24fe97423bfc78e810d7c5c677ef463d51fab4a4a4d72675d953f9b83f

Observation ab292b9c-057c-4cfb-93d9-485bc0db0d26 · outbound

This paper cites Openai o3 and o4-mini system card.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Openai o3 and o4-mini system card

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.612067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.623921Z digest=sha256:527af05b90a4e434abf7de90a58d0f4c414dc09842d6ca1a05a9514dbdb7105b

Observation 0b7c8aca-cdcf-424d-a383-096e779aeb92 · outbound

This paper cites Deep research system card.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Deep research system card

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.595846Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.628320Z digest=sha256:647dea96c78dd171c844105b41cd0318076bc872c9d245daef8bdaa2b0dbea2c

Observation 39c9a6dd-caea-4804-8c19-dbb3e0fca7c2 · outbound

This paper cites Training powerful llm agents with end-to-end reinforcement learning, 2025.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Training powerful llm agents with end-to-end reinforcement learning, 2025

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.581295Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.632746Z digest=sha256:adbed1d343b73edaa8db27d412d86af1e7b058b1316066d36a393219894ff9a9

Observation 6672358b-388b-4097-809c-69c1f972f419 · outbound

This paper cites Introducing perplexity deep research.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Introducing perplexity deep research

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.565235Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.637193Z digest=sha256:beb74d9a17caa9c6a144d80d5929276a4d236cd189bdcff8951618509d9c63f7

Observation 2ce42c27-37fa-4e47-b93d-f7bf0d47e88d · outbound

This paper cites Humanity's Last Exam.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Humanity's Last Exam

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.641664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.641664Z digest=sha256:d985a0fbf04e2ecbf69a113c5ee128b61b7cf14055f598e9aaa24c324fdd5287

Observation 01d27b3b-770e-44f8-901f-9e23d6022008 · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.646033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.646033Z digest=sha256:8680a7723183819d99b4db2fc63a611f07320fc390b48299d0d2db783a38915d

Observation 573eb4d8-919a-42b3-b9a7-f4a316fbadf8 · outbound

This paper cites Infogent: An Agent-Based Framework for Web Information Aggregation.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Infogent: An Agent-Based Framework for Web Information Aggregation

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-04T23:55:39.069219Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.650650Z digest=sha256:81792155c71a8be857059cdc6a57f998bcbc694a88d2b2825108ba57c5509d22

Observation cbc5e7d0-1a9f-4078-8ac9-0e73c1fea282 · outbound

This paper cites A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.655374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.655374Z digest=sha256:aec130c6c03a6171b832121609b43dc14cfb17b8cc309685f15c36050f7cec0a

Observation accfd666-2cbb-45af-b544-ae9267e41775 · outbound

This paper cites Proximal Policy Optimization Algorithms.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Proximal Policy Optimization Algorithms

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.659793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.659793Z digest=sha256:9084f92295a0e27ddc9893e40e404f818584470e1da5bc228f74d6ed04f6fc25

Observation d799053a-5fc0-4899-81d5-7c5721de4bfb · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.664357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.664357Z digest=sha256:490cc0a9408a9760a2580e4afc1d39ebb6292c0dea333dca41cc3a6d6d163f80

Observation 9a742768-3e2c-4bb6-847c-f3905eb78c54 · outbound

This paper cites WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.669645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.669645Z digest=sha256:1ae3368e5b9496bdd0c352f8f3c825365b536703c7406cb59df68e81f0435255

Observation 57ad2de3-9f12-4099-a269-a768eac06bed · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Kimi K2: Open Agentic Intelligence

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.675605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.675605Z digest=sha256:0576d70f1d10abe4f7ccc1c995b580c26da588e3b91e008e214f118d2c41814e

Observation 0aeb0479-c9c6-410d-a767-867b9125d94d · outbound

This paper cites Qwq-32b: Embracing the power of reinforcement learning, March 2025.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Qwq-32b: Embracing the power of reinforcement learning, March 2025

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.680494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.680494Z digest=sha256:4db64b0bb73d1bfa52946417ef6dc957614763dee45afc49ca52a94596ba08e1

Observation c67ed1eb-141d-4ab0-9e51-34aca1d61fd8 · outbound

This paper cites Webagent-r1: Training web agents via end-to-end multi-turn reinforcement learning.arXiv preprint arXiv:2505.16421, 2025.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Webagent-r1: Training web agents via end-to-end multi-turn reinforcement learning.arXiv preprint arXiv:2505.16421, 2025

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.684858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.684858Z digest=sha256:63078d22608979ec6692ffa87be34c5865c8e198841fed00dc0dbf99f01f2136

Observation 0ff5359e-33df-468a-828f-c5c2c23a5954 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforcement learning.Machine learning, 8(3):229–256, 1992.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Simple statistical gradient-following algorithms for connectionist reinforcement learning.Machine learning, 8(3):229–256, 1992

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.689376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.689376Z digest=sha256:247b35af30e6ddc195fccda8a710d802bd8f90b2c64203aa07969565cf7d4c89

Observation aa69e0b8-42bc-40d0-9a86-17b090bdf7d7 · outbound

This paper cites A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.693947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.693947Z digest=sha256:841d990462ec24cb1f5796efa81f4630824d477b43575c9706a386a031a47f28

Observation 41d373ae-bc12-4996-aec3-9f18b32aa864 · outbound

This paper cites Simpletir: End-to- end reinforcement learning for multi-turn tool-integrated reasoning.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Simpletir: End-to- end reinforcement learning for multi-turn tool-integrated reasoning

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.528751Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.698479Z digest=sha256:a805cddfff05b4437ea40a278df166e1476e9c20622674f1e4a451334b348918

Observation 2cce8f09-d5e8-4da4-991b-772f91bade9b · outbound

This paper cites Qwen2.5 Technical Report.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Qwen2.5 Technical Report

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.702802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.702802Z digest=sha256:1fb137d13a7fc4aebe6cd7aba284b16e08c43a7ef9e07b6bebe277dca145badd

Observation 920c0cf4-e4c3-4c43-aad7-994578339158 · outbound

This paper cites Qwen3 Technical Report.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Qwen3 Technical Report

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.707272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.707272Z digest=sha256:93ae109d6a3ba4524a729042f28d9f129aada8e49dabcb4024091e726a060ed7

Observation 068c808d-451e-43f2-bf59-8bc47270f5b2 · outbound

This paper cites Cohen, Ruslan Salakhutdinov, and Christopher D.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Cohen, Ruslan Salakhutdinov, and Christopher D

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.711820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.711820Z digest=sha256:ab733670f24b1df936d488a8fa30568f5637767a2650f608ec1b8b7f00de823e

Observation 5810b7ed-efcf-4f3d-893e-9a391375bf96 · outbound

This paper cites ReAct: Synergizing Reasoning and Acting in Language Models.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents ReAct: Synergizing Reasoning and Acting in Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.716073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.716073Z digest=sha256:60aad7a2cf8a7dd1430fbf8e14064f74b1f1c85382a0759070c322fc5cb066f6

Observation b6bd401b-f6eb-4c37-9660-28cbd0042548 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.720546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.720546Z digest=sha256:57f8c6e2767ac71c3cb031ad1c5bbc2fe759c20ceea767d66c04611147f1aac9

Observation 0faf9576-456a-43bb-9b57-b8aeb3a084db · outbound

This paper cites AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.725026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.725026Z digest=sha256:a5f802e4d1dc67ce1e976af7ef4558390c7204f6bc2b4e6566abe229ce1e5b6f

Observation 3fa87bd3-b355-42fd-9290-6d99c0869844 · outbound

This paper cites Group Sequence Policy Optimization.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Group Sequence Policy Optimization

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T23:55:38.730193Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:55:38.730193Z digest=sha256:eede3f40cae2dc6d65787f7583cce4ff4565587b8eff9891aac1f235e24242c4

Observation ab21033a-882b-4c3c-8ad4-d2e676b3465b · outbound

This paper cites Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583, 2024.

SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583, 2024

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:55:39.501969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T23:55:38.734605Z digest=sha256:4c3721b68a04d9f5ca983536b4181f02bf01fd616d4cc4f793bb465e28406f46

Pith citing papers

Observation 43fac9e8-f59f-4309-a598-e273cd7bff31 · inbound

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey cites this paper.

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents

Reference 289

Resolution
verified exact
arxiv_id, observed 2026-05-18T19:21:48.089808Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-18T19:19:36.427337Z digest=sha256:ee3cbfcf39dff790c6665213d795a7f853b8980eb58540fd1b4fd72ad6b5a4f8

Observation d7e92b7d-3697-4d93-9b3e-5474dbeedd6e · inbound

Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search cites this paper.

Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T08:48:42.025933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T08:48:42.025933Z digest=sha256:b00a2b8f96973d70be65a3686d47e6f03a90cb3b81ef5a6d6296b55232385153

Observation c64481b9-d429-4109-a892-fac6de8f8057 · inbound

MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling cites this paper.

MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-17T21:45:17.902577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-17T21:44:18.744201Z digest=sha256:0adcbcac803e7a5bf323dedec896f8dd83d5f25bc5982b14af455a028682dc86

Observation b01e0d67-d5da-4a6a-8b09-5631a4e29744 · inbound

LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent cites this paper.

LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-07-05T15:11:10.858577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-07-05T15:03:50.420072Z digest=sha256:543378f8a4f711712294cae393f7fc835b7e8e4e2ba7727f07fe6cbd65a9434e

Observation 2989f097-56e3-408e-8468-03fa761b66fa · inbound

EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management cites this paper.

EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-07-02T03:56:35.103267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T09:32:51.765633Z digest=sha256:f761a1995bccb3edb65a2512a12ce28aac7c60bdf3ff0973f47688eb1143b23b

Observation a8d41468-a08f-4be4-98fc-b5866c6e64c1 · inbound

Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals cites this paper.

Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-03T03:57:38.327066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-27T14:23:06.932530Z digest=sha256:83478b13bc16256e258da9ccf50bc325507febd63f47b5c78582860876548956