Pith. sign in

Paper Citation Record · LEDGER

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

As of 9 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 17 inbound Pith citation observations for arXiv:2505.15117.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.15117 v1

Coverage vector

measured 59 of 59 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:26:55.346259Z

measured 76 of 76 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 17 of 17 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:22:18.164811Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T00:55:12.126083Z

Reference resolution

59 of 59 outbound references displayed

  • verified exact1
  • verified fuzzy19
  • unresolved39
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a9c57f54-6a3f-411f-9cd5-c481acc54943 · outbound

This paper cites GPT-4 Technical Report.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.226134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.226134Z digest=sha256:6c7f06a5ce02f643753cc6a0a08c7c772aa2a89a1e60a7f8fe8b08dd717da275

Observation 4b28661e-4667-436f-ad52-9e167fd09ce4 · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.330797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.330797Z digest=sha256:fb1145afdcdb906043dbc49142fde4c9415b223c30a36d0cbc6edc1a687aacd6

Observation 1fbacb48-e9af-47ef-884b-eb32fcb592d5 · outbound

This paper cites Self-rag: Learn- ing to retrieve, generate, and critique through self-reflection.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Self-rag: Learn- ing to retrieve, generate, and critique through self-reflection

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:59.157980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:49.410784Z digest=sha256:d89d2251eb7e662c060370fbbdd764317477d113a246583ea7f0ea7c5392a1b9

Observation 3c45f28c-547c-4ea1-a66b-c9457ded3b34 · outbound

This paper cites ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.507040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.507040Z digest=sha256:d64217898ffee36d209ef236ba13f05f1ef54f35f2484846362120ae13ab0736

Observation 4f6f5d45-770b-499d-a63b-ccc844135ad7 · outbound

This paper cites ELI5: Long Form Question Answering.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents ELI5: Long Form Question Answering

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.595880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.595880Z digest=sha256:4152ca0da0732f551472dd9272c8bbf58d7921e072fd896b8a914238e86dee48

Observation 7b898ac7-96ce-4443-a0e5-0a274b00fb5d · outbound

This paper cites Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.679749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.679749Z digest=sha256:9b1eb0a3b90b20dd5b74d99ef10001018b50fec8822154a2527150b950975249

Observation 56345dbc-a3ed-4a1c-bf4e-68a59f2c5470 · outbound

This paper cites Retrieval-Augmented Generation for Large Language Models: A Survey.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Retrieval-Augmented Generation for Large Language Models: A Survey

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.769546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.769546Z digest=sha256:ec740fc7d49573f1afd6935f5092c0198a88bf266ed140908b7e40aa7fa62304

Observation a9547765-daaf-4d6a-b000-24d7e114b491 · outbound

This paper cites A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.877999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.877999Z digest=sha256:036edf47ed4548f0147f6c1b7fc5c4e003aa4d6792a5ef927e29cbd7eb183639

Observation 585497cc-a9c9-4f4b-81bb-fa58ff551145 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.967806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.967806Z digest=sha256:d2a3daea93e711bf55b122697d5acf25cc2852d95b7a7f42852f6b45280c60c4

Observation b7630dd5-73ac-4352-be50-f252bdc34117 · outbound

This paper cites Training Compute-Optimal Large Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Training Compute-Optimal Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.082149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.082149Z digest=sha256:27b5acee74daf18dbaab15d254534320187d1f076cb3aa181f368a610679db69

Observation f6534b44-fd37-4592-977e-7376e1c91ff2 · outbound

This paper cites Long-context llms meet rag: Overcoming challenges for long inputs in rag.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Long-context llms meet rag: Overcoming challenges for long inputs in rag

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.985496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:50.196189Z digest=sha256:505536c7751b834e11de136edb1be512cdffd537e679ca156cba5f1e677a82e9

Observation 717a137d-4795-4d92-aa45-2f3bd6b12ce5 · outbound

This paper cites LLM Alignment as Retriever Optimization: An Information Retrieval Perspective.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents LLM Alignment as Retriever Optimization: An Information Retrieval Perspective

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-07T15:26:55.887278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:50.289327Z digest=sha256:75ebec779ef5bc806010f0ba2a0dbaa635ba0a6a616d7bf05b076cffab9117ed

Observation b058ef94-0010-4640-97d2-ae7ecdca5340 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.403376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.403376Z digest=sha256:a4aa60008488db1049c466cf4a1b99ef02c54984042580983292655472dfaea0

Observation c3821500-bdf1-4fca-a0d4-f43e0ba4cc4c · outbound

This paper cites Reinforcement learning: A survey.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Reinforcement learning: A survey

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.841646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:50.494200Z digest=sha256:62421b60c23a9f8711c94cc52e967286467dd557ed5caeff494147969ba38e43

Observation 19e1688c-cfa7-418e-a7fc-348c0c3c9b8c · outbound

This paper cites Scaling Laws for Neural Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Scaling Laws for Neural Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.590956Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.590956Z digest=sha256:e9f50c48d7c956bf3f5e869dfc2b8569c6d92d679370a3224b15848298f17a50

Observation 03d37d64-fccf-4d4d-aba6-85a748414895 · outbound

This paper cites Dense passage retrieval for open-domain question answering.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Dense passage retrieval for open-domain question answering

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.703594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:50.679252Z digest=sha256:3a60a4af516b48985a24684db71745ddcffeda34b5333616bf0754d7d9ff96c6

Observation ca007945-7e15-4249-a24c-414673a7b03d · outbound

This paper cites A survey of reinforcement learning from human feedback.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents A survey of reinforcement learning from human feedback

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.748824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.748824Z digest=sha256:82d200d7dd61c70ff903498ff4fb90a829907c05b98f80b0ac4cc44c50164c08

Observation 4c94b57a-382e-430c-a0c6-0d0c5fc7a1a3 · outbound

This paper cites Natural questions: a benchmark for question answering research.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Natural questions: a benchmark for question answering research

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.837507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.837507Z digest=sha256:8faa5d38520b5accb7ae1d45f461adb7977655731c8d6b8d0f20579858440a62

Observation 17f0a0b5-8016-4d30-81f7-4fe71c83a2e4 · outbound

This paper cites Med-r1: Reinforce- ment learning for generalizable medical reasoning in vision-language models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Med-r1: Reinforce- ment learning for generalizable medical reasoning in vision-language models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.909895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.909895Z digest=sha256:d5e28d15df0e4d79ac64813300895ba35624e8ec3326496dfb143e44181a91b0

Observation 1f416758-8579-4885-887e-dad10bb3f9d6 · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents RewardBench: Evaluating Reward Models for Language Modeling

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.989095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.989095Z digest=sha256:fabadb0d7a4b2987918440a2b36e23cd214abf48cce757ee76cf03c9d5e7088c

Observation 2f145531-f0a2-41ec-880f-42eba51ab072 · outbound

This paper cites Large language models in finance: A survey.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Large language models in finance: A survey

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.568392Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:51.109969Z digest=sha256:c689b2d463fb4e88cdea538919956c4833332b502179f3fbd9d6e8164c5b5e5f

Observation c74cf3b1-65ef-40d7-b028-718a802ccbb9 · outbound

This paper cites Rec-r1: Bridging generative large language mod- els and user-centric recommendation systems via reinforcement learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Rec-r1: Bridging generative large language mod- els and user-centric recommendation systems via reinforcement learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:51.227945Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:51.227945Z digest=sha256:867856e4932ef4d360cde78d2a3f4eaf3e3f306786998d2ae9d4470186806f0b

Observation 31f92054-4f7e-4285-b9cf-38cd12aa6c34 · outbound

This paper cites Ra-dit: Retrieval-augmented dual instruction tuning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Ra-dit: Retrieval-augmented dual instruction tuning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.456715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:51.320200Z digest=sha256:c8d18d21fe1bd76fecb1fb01e77dc8eee8d80634d8f14db0317abed691a4d588

Observation fca8fc0a-f564-42ca-9bd9-479b52f91105 · outbound

This paper cites InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:51.429733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:51.429733Z digest=sha256:e19032109a37b89e46b4e1b76d7b14aa1caa40770eff1e51289347c8a23ead15

Observation 341d1ffc-de10-4f4f-8fa8-20f9a82917f2 · outbound

This paper cites Fin-r1: A large language model for financial reasoning through reinforcement learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Fin-r1: A large language model for financial reasoning through reinforcement learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:51.566362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:51.566362Z digest=sha256:ac517a7899de25b9d317fb8974457ecc4db182e8a950c3e08dae55f5b66ee9a4

Observation 5f61c753-65e0-45a0-ab56-5b0dee9f94a6 · outbound

This paper cites Chatqa: Surpassing gpt-4 on conversational qa and rag.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Chatqa: Surpassing gpt-4 on conversational qa and rag

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.324495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:51.658947Z digest=sha256:e703c160693b7acde681c0f39e01308ab333ae8f8d175365635b5efc6955208d

Observation e7884401-3cf6-45d4-ad39-d78d65af419e · outbound

This paper cites Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.190378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:51.746406Z digest=sha256:bdc0fb7a51d2810bcc282a8c6cc41e7b7ef1ba39d6c4ed6daf1595a98d3635ea

Observation 595bedd6-b420-4b9a-827b-64e5da074ae9 · outbound

This paper cites Training language models to follow instructions with human feedback.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Training language models to follow instructions with human feedback

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.990089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:51.844156Z digest=sha256:38ac1dc87350d0c070145139b5d772aca452066bcb420c7061b6214e7c910e79

Observation 195f0ec1-8ef3-4d27-9893-765da6383166 · outbound

This paper cites A study of generative large language model for medical research and healthcare.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents A study of generative large language model for medical research and healthcare

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.826853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:51.933207Z digest=sha256:58cae18afacc9c512180a5f9c88a894d7e4a130b84de5e7c0aecb3636a98d6ff

Observation 65ef205c-a837-428d-8b96-ef6feb42b081 · outbound

This paper cites Measuring and Narrowing the Compositionality Gap in Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Measuring and Narrowing the Compositionality Gap in Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.033954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.033954Z digest=sha256:01257b1b5ebd8a7c477d7aaaeaa5e64c89a5ef7aee9b7106d7269399f39550d1

Observation 5d464510-268c-4b36-b755-855e0b957174 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Direct preference optimization: Your language model is secretly a reward model

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.134087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.134087Z digest=sha256:49a6e798795cc1c9efd5829fc35e4dde94604bf333891059d44d3c8980677a39

Observation 06269762-9b6c-417f-aa33-40161e185fee · outbound

This paper cites Gpqa: A graduate-level google-proof q&a benchmark.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Gpqa: A graduate-level google-proof q&a benchmark

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.661037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:52.283836Z digest=sha256:64aa4b11d4c8fb7d07dea9bf29c2600638b8b57af2fe2a1b6371442641aae2d1

Observation 900386d5-fcba-4598-9226-f38f09ab511a · outbound

This paper cites The probabilistic relevance framework: Bm25 and beyond.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents The probabilistic relevance framework: Bm25 and beyond

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.466025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:52.398976Z digest=sha256:4a0799d37f4d6c14aeb1ba9278205465455cc8551d13425be76827caaed18410

Observation 40aa8960-f10e-434e-bb78-93857c0be9d5 · outbound

This paper cites Toolformer: Language models can teach themselves to use tools.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Toolformer: Language models can teach themselves to use tools

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.242610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:52.535004Z digest=sha256:78c88307d8a4036e9c681fd6c88d7b7e6767680c4424d3c859d96e96856dcd74

Observation 6b9a6faf-50e9-4218-a32b-4af6ddb29e7d · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.616549Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.616549Z digest=sha256:edeada64bb44db2a6e7704186bde058ffc46af7fa0e62958931de67bc7156079

Observation 9023e9e1-0bed-4620-812b-fabe429d2868 · outbound

This paper cites Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.754080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.754080Z digest=sha256:91afee0c8b83e15b0bfd34fb684fac2fb072723c93881f6069ca92f33de8ee2d

Observation b6a6294c-588d-4f46-8ec0-7470b7666aad · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.868730Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.868730Z digest=sha256:7ff8f6b8c1678dfb170fc57b9aec16fc1debfcc537caf1e5b124cdf8e266688a

Observation 7c40fc6e-ebcd-4414-b549-c8fb80e980cf · outbound

This paper cites ASQA: Factoid Questions Meet Long-Form Answers.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents ASQA: Factoid Questions Meet Long-Form Answers

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.983403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.983403Z digest=sha256:719845107d4de57cf082eab4e80148e69665a4543f888b3fa874c4c47e72f12c

Observation 3cd1d6d0-871e-4444-896f-883123a0a9ee · outbound

This paper cites Reinforcement learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Reinforcement learning

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.086436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:53.080773Z digest=sha256:f0aeb876f7105c52f0316f0d1b1105d4b008a2bbb2d5daa409600cc3e93cb71f

Observation 4333ad5d-3a13-4dc5-b02c-a338220a6faf · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.199033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.199033Z digest=sha256:d80cea5f233ec05e56775348f670df801c358e20ed2aca9130abc2fcf9ea7517

Observation 9903980d-f83a-470c-b809-9297b5fa6ff9 · outbound

This paper cites Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.311795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.311795Z digest=sha256:61a5196d07cec567ceca543ee4738e2824c04a49601bd5e4d6edf3e7f8cbb120

Observation f818db25-cce8-4a26-b6db-dc0742739ac5 · outbound

This paper cites Text Embeddings by Weakly-Supervised Contrastive Pre-training.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Text Embeddings by Weakly-Supervised Contrastive Pre-training

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.451848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.451848Z digest=sha256:a77867b61996884204acce105cd4d03618e92a40baccdc8f63d6b647686f1235

Observation 13cd128c-5533-4061-9103-9dd198580236 · outbound

This paper cites Reinforcement Learning for Reasoning in Large Language Models with One Training Example.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.529810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.529810Z digest=sha256:92b8f6b5ca1a4513b812a076279348a8f9c4d63e8f8ad575907357d36c813ab3

Observation 1454a45e-770d-4911-bd2a-429324bdc637 · outbound

This paper cites RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.665506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.665506Z digest=sha256:ebf7bc43f3ab99237aa292c0567554c53a07de319fdac736d3c88e0941496f82

Observation e68b8865-606f-4ebd-82f2-24226fc8b8a3 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Chain-of-thought prompting elicits reasoning in large language models

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.850656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:53.780369Z digest=sha256:dbb239e11aa8329d7658ef4e39ff84603bfd68b5add2c8fbe7359ca4e159cefe

Observation 29f35dad-8602-4e0c-91fc-4b05780a2a6c · outbound

This paper cites Measuring short-form factuality in large language models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Measuring short-form factuality in large language models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.898164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.898164Z digest=sha256:cc0e247df899da363bf1f8e5d438d062538d3769469d12d0d0e53ea98ecbf742

Observation f124a3f5-834f-435a-9c0e-b74acc1ed4fd · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Simple statistical gradient-following algorithms for connectionist reinforce- ment learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.675204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:54.004145Z digest=sha256:3633cf166883fec1ff95c77e19157ba463ed21e21dfdd4ee90d2bde4f463c8ca

Observation bfd1f691-7fa0-4e1b-8cd1-5f61af21abd6 · outbound

This paper cites GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.106018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.106018Z digest=sha256:c23c966692e6fa21c68c40f0ab1f273db4289601c8f04779c10c7bb58354dffa

Observation 0be230af-cc11-4b04-9d36-a1791b7f2d74 · outbound

This paper cites Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.279168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.279168Z digest=sha256:11861a6844171f24992e1510260f06e23700fb580244db7d044cf882820265ec

Observation 92849fa8-cbaf-4c54-a339-5130b46e8ab6 · outbound

This paper cites Qwen2.5 Technical Report.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Qwen2.5 Technical Report

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.391914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.391914Z digest=sha256:052fd02b089cb600617ebd77411c7384b6c6e419ba5197f9226cda5d94ef7c58

Observation 0e2d6c4b-4939-4028-9f89-0c0439cf2f94 · outbound

This paper cites HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.470888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.470888Z digest=sha256:b8add1eb7f26dda8c1652cf0af052e8f24ea8167dbb60831a0902663db16c8dd

Observation de6b9cce-e7d1-4489-ae11-6655f4e0edc3 · outbound

This paper cites React: Synergizing reasoning and acting in language models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents React: Synergizing reasoning and acting in language models

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.510314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:54.608235Z digest=sha256:1dbac33ac200ede5f8a8e745fd098d77f9b2ec9408992368356346f83e76521a

Observation 33aab401-0b34-4dc2-9521-4f7dd023735e · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.687871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.687871Z digest=sha256:1d1a10c517c4712d64119199e0f72b822de7b97a1ffba12e2dafea29cdd7f712

Observation aa196788-e30a-4150-803f-794700ddbea6 · outbound

This paper cites VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.812847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.812847Z digest=sha256:aa31ec012d1f2d70505de9c1adad4f5d65e81620c0d3fac45f44400afff6342e

Observation 05a4234d-b062-4944-b633-d5c847f3be3c · outbound

This paper cites Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.929294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.929294Z digest=sha256:46d9d7fff9c5dc98134f72ab480aa5045a146e5084f0f253a91cf253e31c6db6

Observation e3747c8b-8768-4e14-af6c-d6ce749ab8c3 · outbound

This paper cites Benchmarking large language models for news summarization.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Benchmarking large language models for news summarization

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.319879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:55.004398Z digest=sha256:5bcf68d340eb96733f51709d5268dbad35db829b0b8a63c9b73b26481563f11c

Observation a765309a-41f1-4b5f-a97f-40bee11c104a · outbound

This paper cites A Survey of Large Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents A Survey of Large Language Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:55.141146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:55.141146Z digest=sha256:e28763e7f4569c1b51e7d0d8a0fbdc4e97ccfdfc4504c26ac9d71fbdf598f506

Observation 46073e24-a2eb-43b6-9e9a-90fc8e3369fd · outbound

This paper cites DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:55.223022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:55.223022Z digest=sha256:9c17b8eb19c8f7c0243ec2cda4ed3ad1e81a1d19ac8d8c8f4c221ff9d074011f

Observation 6bb5f631-5897-445b-b8eb-09fd812f0456 · outbound

This paper cites Delicatessen.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Delicatessen

Reference 1953

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.105243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T15:26:55.346259Z digest=sha256:d94f011b549107ce12cacabd457d47637a470f306b9f7cf86e7dd3a158c70d62

Pith citing papers

Observation 38b539da-c53c-43a2-8365-fcfcebcd6817 · inbound

A Vision for Geo-Temporal Deep Research Systems: Towards Comprehensive, Transparent, and Reproducible Geo-Temporal Information Synthesis cites this paper.

A Vision for Geo-Temporal Deep Research Systems: Towards Comprehensive, Transparent, and Reproducible Geo-Temporal Information Synthesis An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:22:18.164811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:22:18.164811Z digest=sha256:b6f557fc4147fc8e570b8be753ee80f8159a0ea7a47d04d4c32900587be97572

Observation d87aa6c1-0808-4f41-9a4d-e7235a8a94d3 · inbound

MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning cites this paper.

MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T10:17:13.579736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T10:17:13.579736Z digest=sha256:43430427383276096b56d7f778e8c07d4badc6c2d194971180fe4bb2c05f27a2

Observation 11891e05-7f2a-46ad-a05b-74e367e31854 · inbound

BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent cites this paper.

BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T22:46:12.625929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:46:12.625929Z digest=sha256:750e98b098698082cdeb86526fd5ab24365efe00dd28cb1c7c58be68a01b3102

Observation 3e06a672-a89a-4390-a2df-320dc727fe33 · inbound

SSRL: Self-Search Reinforcement Learning cites this paper.

SSRL: Self-Search Reinforcement Learning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T20:17:09.393341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:17:09.393341Z digest=sha256:eeb76b01306b50cc54274f0b17d381050441c4dc06a43ac3f0927f9d3520b35d

Observation 9b1aa506-a3b4-4efe-be0a-52109793cfd1 · inbound

A Survey of Reinforcement Learning for Large Reasoning Models cites this paper.

A Survey of Reinforcement Learning for Large Reasoning Models An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 244

Resolution
verified exact
arxiv_id, observed 2026-05-18T00:02:24.586905Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-18T00:02:24.352947Z digest=sha256:16c99465466c9ea73b0bf006bf82d6b5aa69846b3972e7546524a3be029f591a

Observation 0fcab628-5b5b-4eea-af6c-c1a9c9c9a03d · inbound

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs cites this paper.

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-18T11:11:18.283961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-18T11:06:20.058342Z digest=sha256:12f73920ac7090cd48a4c40a35269e3ee5f0f385ab633a51a3c64a5b23423be5

Observation 6118e055-e4d6-4a0d-a75a-e3427ebcc2c3 · inbound

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation cites this paper.

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T09:50:45.763606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T09:50:45.763606Z digest=sha256:d65c89b9bbebf692e51f8c73da6fa8959207c48d38eda0c124556c534f36835d

Observation 785a30ee-2b24-48a5-af96-a455692b9848 · inbound

Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search cites this paper.

Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T08:48:40.941733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T08:48:40.941733Z digest=sha256:1c167fb36a432a4c40e88511abda2fc9e834b3df64da5d6e0dba3d1c1034aaec

Observation 85761933-03a2-4669-961f-021236f6c4fc · inbound

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework cites this paper.

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T23:33:45.833809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T23:33:45.833809Z digest=sha256:168db9fc1e82ff69bcca3ffcc072949676221806c563638d3fcd84e5a6948a58

Observation f189d6d9-658d-4f1c-98a6-3b1e506dc583 · inbound

ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning cites this paper.

ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T17:53:54.804421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T17:53:54.804421Z digest=sha256:b12587be1e86a69302a21195abebea6fceb04ffb5ad5f55fd61f655e50b7b63e

Observation 7cb12523-4345-4d84-a68f-d2958bf61d59 · inbound

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data cites this paper.

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:46:06.919257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-09T15:08:53.731480Z digest=sha256:9af8914f45642263690cb9ccb41995a7508d02fbaf135e3b876e2519c7419da3

Observation 600bc524-c3a1-494f-99ec-69a625a52d40 · inbound

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data cites this paper.

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:55:12.127996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-07-01T00:48:54.797750Z digest=sha256:d652b1f8c120a8bc0b148ff2d3a69f2609f6581f6c90e5ff4261c249d3e80337

Observation d8193e3d-2d96-468a-b0f0-524b0649de2b · inbound

Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning cites this paper.

Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 20

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T16:51:08.796266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-09T14:40:23.170932Z digest=sha256:4096547f93d2d08701d268fc14184a8fd2ad47ed57811d6d5193077a4cf92ccd

Observation e03c2656-8aee-4852-8bbf-20f7a3d434a2 · inbound

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG cites this paper.

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:01:12.045981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-08T10:27:00.257353Z digest=sha256:a08b36876c2adb01950c756d277fe6ff12501ef28edd9bc4d303e01a3a8c66eb

Observation 8fcae104-3086-451d-888d-490e03e36875 · inbound

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents cites this paper.

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 21

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T12:53:26.519864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-29T12:50:16.625077Z digest=sha256:c0ecab9c32cc3b98040b5d2ebac4fda16f9e47af49381e0ce4609d964492bd43

Observation fe7c2143-8f14-4272-87fe-6dcc857aabba · inbound

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents cites this paper.

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T03:10:51.532947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T03:10:51.532947Z digest=sha256:07b45a267781edb20d427a02889d441aeafd004334bc9e1840d678b9f55a537f

Observation 3f450e9f-b910-4ae1-be33-eae85bac52ea · inbound

TCPO: Turn-Level Credit Policy Optimization cites this paper.

TCPO: Turn-Level Credit Policy Optimization An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T23:23:14.639942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:23:14.639942Z digest=sha256:0750067fedc1515a344fa56275c590b4fd70ebeb9637d70311b7d26d650a5f46