Pith. sign in

Paper Citation Record · LEDGER

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 14 inbound Pith citation observations for arXiv:2506.04185.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.04185 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T10:54:30.541560Z

measured 58 of 58 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 14 of 14 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T21:12:12.793725Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T06:19:38.663842Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact2
  • verified fuzzy1
  • unresolved40
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fbdc3536-4226-4620-aa14-1d80f49ea013 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 1

Resolution
verified exact
doi, observed 2026-08-07T10:54:31.014255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.274335Z digest=sha256:cb4d3bb378b20fac164acf8bb573acc341187a03916ccb11ff8056de2dc3b320

Observation c155b641-b8d7-4924-8234-4a2ea31e74bf · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.280264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.280264Z digest=sha256:07a4d01f6d52e5a299ccf25629698892544ca9809619684d95ec7eb53afeb039

Observation 728e8402-de64-4bb0-9f16-18a2cbdb3567 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.438391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.285547Z digest=sha256:6663afe727ff6ef495e848ef31dc63dd2886a15b862b735e78c7f3248d3f586e

Observation f14615f3-bf2f-4d9f-a4a3-038dbcb03f25 · outbound

This paper cites RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.291283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.291283Z digest=sha256:e081ea64df0416189bb775613781a7b8e8659c50b6f2c10f2cc76c01eb173903

Observation 0458c6c1-fb1a-4acc-99d6-97775c449014 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.422082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.296904Z digest=sha256:8a949e9db8f706de316434b8c7a3c12187bf18b8a05bb69f345bedd95bb770f5

Observation ea1ee574-c118-4222-b4dd-7a7a6fd9f773 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.405352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.302594Z digest=sha256:f3dea961ae81d3dbc6ef0531b15fc060117a17bd02276f0f650fe4a2ffb5f17d

Observation b5b447c7-48d1-455a-bb56-c6389374d78c · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.308393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.308393Z digest=sha256:bee01d9363b54f98f612d98333806a970b841ade2566065120ad5709e7c37ec4

Observation e4d27694-6d90-4eab-b4c9-3dfd99f42d05 · outbound

This paper cites Retrieval-Augmented Generation for Large Language Models: A Survey.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Retrieval-Augmented Generation for Large Language Models: A Survey

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.313372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.313372Z digest=sha256:9bd66036e4fd952bafb3474bdcafca42bac1126ae4467503d8f703bd7602f170

Observation aefe27e4-2382-442a-85b2-ee35c1f8f2b1 · outbound

This paper cites DeepRAG: Thinking to Retrieve Step by Step for Large Language Models.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning DeepRAG: Thinking to Retrieve Step by Step for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.319046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.319046Z digest=sha256:b99803e84aa8fa57a8a3c51d1c515b5c390dd1ba64577979dead8a26a883a136

Observation 3dae0aa0-caff-4bfd-a084-1803c332fe30 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.324627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.324627Z digest=sha256:7bcf26eca9831fa7c3418f13bdcc86940794ec137ff24158886f772a119dc415

Observation a2117c3f-9435-42da-923f-427d56c31482 · outbound

This paper cites REALM: Retrieval-Augmented Language Model Pre-Training.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning REALM: Retrieval-Augmented Language Model Pre-Training

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.330000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.330000Z digest=sha256:e08ae8156d053f667358d5a3d8c9c63eeae0705a29dc40be1512d37554623445

Observation f8cb34d6-2812-41e1-bfc2-cf3f690c9db6 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.338794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.338794Z digest=sha256:cdf829d6d0a02464ca22c7bc5a07e4e81732c1a95f2b13c675905a4b824f4646

Observation 7f6099d7-897f-4297-ab19-3e0e65e07534 · outbound

This paper cites OpenAI o1 System Card.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning OpenAI o1 System Card

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.344581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.344581Z digest=sha256:e3cb1aef4b09e3568b5842bb2821236a893d4a956a7c61848ba9ce2cb4e3d8e0

Observation 408e75e1-1756-4072-9b89-bcf8d9d25e38 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.350126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.350126Z digest=sha256:52ecca1a514707fc61bcc894f7071f9b3e5f23c4598b7830c72898596ffa1ed7

Observation 52555175-f859-48d1-9c71-24b6822bb064 · outbound

This paper cites Xu, Luyu Gao, Zhiqing Sun, Qian Liu, Jane Dwivedi - Yu, Yiming Yang, Jamie Callan, and Graham Neubig.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Xu, Luyu Gao, Zhiqing Sun, Qian Liu, Jane Dwivedi - Yu, Yiming Yang, Jamie Callan, and Graham Neubig

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.355185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.355185Z digest=sha256:383810ef46ddbb4c16d16fc72b92fdcf735021b0d913cb9d80852d90bb946473

Observation c274fb56-4c2b-4edd-af2c-0b8fb4f8b6e6 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.360587Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.360587Z digest=sha256:203bb9f1b679e8edfabf811337320147f5c417975792f37c1ff86edc73ea488e

Observation 9c9dacb0-3a3c-45a9-854f-ae11ede5480e · outbound

This paper cites FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.366802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.366802Z digest=sha256:4c75a851badb09eda51a76fbf86cfc0cc36877f0007d115b783e1e439ccf02f6

Observation 627dcc3a-6959-49c1-b1bf-f05d5267f601 · outbound

This paper cites Weld, and Luke Zettlemoyer.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Weld, and Luke Zettlemoyer

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.372406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.372406Z digest=sha256:911dd037e6d78fb1cf3853232dcbdc39599bf52e1851cfdad5fef5bd5e68d2c1

Observation 20bd6a40-5b96-4d90-a4ef-8a52550e4607 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.377138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.377138Z digest=sha256:4922b0025432f70f06c8bf35eb23e810c3a5aca185f9133c639bd7f8491219cd

Observation 2c522333-8a80-4eb4-8078-4b876b79c84a · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.382234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.382234Z digest=sha256:c9af22bf515c9818f7d821b2f1b9bcd1499f78477cc45d9497400c12ab792235

Observation 17d2ab95-057d-402f-9bee-7ed50560ea97 · outbound

This paper cites Training Language Models to Self-Correct via Reinforcement Learning.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Training Language Models to Self-Correct via Reinforcement Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.386949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.386949Z digest=sha256:a70f595eeafa10f2edc2c157462c6b6d8aeeb362b160930e1818221022c3a978

Observation ca83f98c-38fb-4070-ab48-be9fd457c959 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.396880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.396880Z digest=sha256:1bcea42c0669588fcb2f0215a770b28a3c2b0dd440dc709922403e15b81abc3c

Observation 3a196208-39d9-4970-9db7-a4b97e708d13 · outbound

This paper cites u ttler, Mike Lewis, Wen - tau Yih, Tim Rockt \.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning u ttler, Mike Lewis, Wen - tau Yih, Tim Rockt \

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.402416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.402416Z digest=sha256:7babcac8e6b9ce0db61d5da49e1587e600a2d93b933de2ae040de48d49d2fc92

Observation 46fda872-3ffb-4558-a455-605f44d7e1c4 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.407013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.407013Z digest=sha256:444a1f96156d986ed5fa692691bd8fe9d5d5c2f9f8724f200794486da41fe3b0

Observation c433b464-ea9f-4427-b624-05adb958da6f · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.352675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.411984Z digest=sha256:3cb60ae34d80fe83c2ed2cf3c1a624aece56f9e570e064719461795af128dc63

Observation c24b190f-2bfa-4b03-aadd-3d8b7aed4419 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.334046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.417627Z digest=sha256:be4d24c230b7ce371ae32015c31e21cebd31b51bb7f38e3cb22bb158615a906f

Observation f8bb9a67-7d7d-4f46-b83f-0bd423b7d5cf · outbound

This paper cites GPT-4 Technical Report.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning GPT-4 Technical Report

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.426294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.426294Z digest=sha256:c7b96b0956bc5ca7c3a63a74955b8bb3847e12ee11106c9d69f6ea8b5a5061a8

Observation 6d686e0a-dd7c-4f91-acc8-61c7629fb771 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 29

Resolution
verified exact
doi, observed 2026-08-07T10:54:30.814271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.433102Z digest=sha256:79b9b7c537c3927dc009d6d38bdc0cd06e1ca87ce2933495e57af62a80254f3b

Observation dc63a20b-8944-4eb4-bc6d-1ece1d2221cb · outbound

This paper cites Smith, and Mike Lewis.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Smith, and Mike Lewis

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.438229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.438229Z digest=sha256:f7e2109c5879382923cb7d5c0869f9613a4ebca1d805508e7ab34fe5c4f3b5b3

Observation fcf82ccf-3bca-47ba-9c8a-d3e1b1016088 · outbound

This paper cites Hamilton, Chris Dyer, and Dani Yogatama.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Hamilton, Chris Dyer, and Dani Yogatama

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:54:31.317364Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.452391Z digest=sha256:a8971c16fda8de726f768af3ce5013205a55b6b97d8cdfb249cc6b8f4ab9e4f6

Observation bae75213-a5d1-42b0-86b0-f506496e4722 · outbound

This paper cites Proximal Policy Optimization Algorithms.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.459827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.459827Z digest=sha256:4bce1d6187b5c1ab6ab89d8eb580ef87d02285515f6cf93b1b19d4a398f18e12

Observation c30857ee-2823-4424-89db-3c9bbfc19591 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.469858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.469858Z digest=sha256:55452ee59460018f0ad85706dd53e2a8abe9fb471dbf7a95760249a195876810

Observation d8032718-9c9e-405e-a0c7-87b19773f16c · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.477067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.477067Z digest=sha256:ce07555d7ffd8e73297ae65f176561dc82ca975f67ef957721cbafc4aa94ba5f

Observation 18bd1d35-7962-433c-85db-c9a5f62d1ff6 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.490021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.490021Z digest=sha256:c1f325e7a6160c83cecc792d71258b91f5c7fcaa04007f681bef604eb9696866

Observation bd59f18c-0d90-4f7e-a453-cdf0ff7fbca9 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 37

Resolution
malformed identifier
no resolver link, observed 2026-08-07T10:54:30.496064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.496064Z digest=sha256:b2179085355fafb5cc65e220f36ead1da9f1253e4f89b80704e38efb9721ce7f

Observation af55d101-5b80-4f5e-ac71-85e70df80ed6 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.500940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.500940Z digest=sha256:26343c3f788dc04647d55d27f899f82a3474a5fc8649705b8121d30b6825f43f

Observation c931d564-86c3-4854-8096-736595ec00c7 · outbound

This paper cites Large Language Models are Better Reasoners with Self-Verification.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Large Language Models are Better Reasoners with Self-Verification

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.506047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.506047Z digest=sha256:c235326f26b1304383124c6b6f964332af6ec3c12ecc4036bcfe68f57d682741

Observation 5a9be03b-020e-41a3-9b34-421110aa12fb · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.299174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.510945Z digest=sha256:26c91c82e119487034383d30a48435e51dadabede1f92090effa4f110fac100d

Observation 82a47b6f-2838-4763-95c5-5382dddf54a7 · outbound

This paper cites Qwen2.5 Technical Report.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Qwen2.5 Technical Report

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.515642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.515642Z digest=sha256:3db6a1bbe00ad4cfbbdba9172ac17b3062930c5e14b90e6aa938a315e2d05eb0

Observation a9a73950-9e81-4df9-97c0-d657ab55938b · outbound

This paper cites Cohen, Ruslan Salakhutdinov, and Christopher D.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Cohen, Ruslan Salakhutdinov, and Christopher D

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.520686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.520686Z digest=sha256:55cbedbe7c6e8c85a99d81cf6377140a75c18526ad86b0f3b46fcbaae1141ab0

Observation 274306c3-fb9d-4eaf-9901-3a7d595e016f · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 43

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.281471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.525537Z digest=sha256:c53fddc40b925cea1392c6cdea38399e07825106ff0a2c05e41bf2e2c275b6dc

Observation 2f4f4220-882a-42d8-b558-e67ea766ce81 · outbound

This paper cites ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.531319Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.531319Z digest=sha256:d7db6405ec3d4737cece836fdd51ab3ef199583b529021df50b52a4388588994

Observation eb7b1617-4827-4063-a3b5-eef1198cf550 · outbound

This paper cites Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.536308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.536308Z digest=sha256:31c6dc039eb1e759f54908626be78a7cb489f251b527b5d5ae96638305cffcdf

Observation 49404bab-a40d-4d0f-8bac-a4fa4024a915 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.263577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.541560Z digest=sha256:142ee7928848477c742c42a4cf5ea5e51114e727a3193f62c3cda4e576b0bc3c

Pith citing papers

Observation a035ada7-ce11-4bbb-8836-820e9b7b309f · inbound

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning cites this paper.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.793725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.793725Z digest=sha256:86d724a1041b53ecaa52eedbb3a35a9b326d2b4db0f56300db813da1e3e6020e

Observation e1aa069b-9b7b-46a1-aba8-ddf010ed2d6b · inbound

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs cites this paper.

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-18T11:11:18.237838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-18T11:06:20.058342Z digest=sha256:e8ad0f8095bf5455bbfdc61f5ecb3d31e014254ee4e3de60bf805eb86a070232

Observation a70854fa-5586-4614-b096-b05e0ba3d765 · inbound

Learning to Trust: Dynamic Utilization of Retrieval-Augmented Generation for E-commerce Search Relevance cites this paper.

Learning to Trust: Dynamic Utilization of Retrieval-Augmented Generation for E-commerce Search Relevance R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-18T08:11:07.182204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-18T08:06:23.479875Z digest=sha256:f4de57c48904ccb61dfa572272467dc2aae6dbecb60aa35efef588dcbc4e235a

Observation 6f35d705-251a-4281-a182-3841362f4f59 · inbound

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation cites this paper.

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-04T09:50:51.764147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T09:50:51.764147Z digest=sha256:6a6d0f38c29e4f32fc921693d36f37ba745b7ddb7bd17ba4ea44a4f91f6231a7

Observation 84164662-8da3-46e0-b4b5-be266237471d · inbound

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG cites this paper.

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:01:12.182325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-08T10:27:00.257353Z digest=sha256:3849e4ef78c371b2408c75e7337177f2df7954c8a2f997028dfe49de43d7b612

Observation 7f9edbd2-78df-4063-88ba-511dbfaa9a57 · inbound

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning cites this paper.

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:06:33.516677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-12T03:45:06.199636Z digest=sha256:f0ba938a8b155f98b955709a324cf378ad289f08044a0267f1f4e9535a93e0af

Observation a8f2398a-4187-4976-af04-f952f24d8fdf · inbound

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning cites this paper.

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-05-20T22:23:48.394171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-20T22:19:49.016156Z digest=sha256:7a492070caff282959efb99dd3e0f0b578d58d6d014947006f94f0d5d5442a96

Observation 8c269676-9853-4254-ae24-6187fab04f09 · inbound

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning cites this paper.

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T12:53:27.006970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-29T12:43:58.323948Z digest=sha256:113c3e68d6609810e0298bf9f1952d7a213920bb8892715df622c7b2c9b1fa49

Observation 48e413c0-87bf-409f-9bd6-e0dcad6295ec · inbound

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning cites this paper.

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T05:01:11.073781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T05:01:11.073781Z digest=sha256:83e8592789eeffd49208cb80629d287d83f30ffc8ab1d7552bf152c5d6d770c1

Observation ff0c6177-c78e-43ad-b05b-23eb7ce5d77b · inbound

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents cites this paper.

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-07-04T06:19:38.665573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-26T14:33:50.123077Z digest=sha256:17d55111cb6bd5bcb027c1760dcacf4984abf0a6c99116df5eafc1de654749dd

Observation 018f5e59-856c-457f-8186-0402c437d89f · inbound

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents cites this paper.

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T10:43:55.436888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T10:43:55.436888Z digest=sha256:879b673b8208742dc830b505af1b9c77a11877d22a158a24d8432d69ee0531a3

Observation 0ee5da9b-6551-4441-a027-aeaa9de77755 · inbound

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents cites this paper.

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 72

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T12:53:26.535103Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-29T12:50:16.625077Z digest=sha256:c3215d943556c6e07182a8230535372e7eb19ac342aff86694baf8865981ccb0

Observation 4edeba9a-bc41-4575-8bbc-4c477388e225 · inbound

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning cites this paper.

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-01T13:54:23.891567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T13:54:23.891567Z digest=sha256:6b8a4a39bf76ff0ea5e5de409d921ef8918163b6b9254f78c336fb0f4b5833ed

Observation 3e83d5df-5c7a-45e8-9376-d24c1ef67354 · inbound

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents cites this paper.

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 104

Resolution
unresolved
no resolver link, observed 2026-08-04T15:12:55.776464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T15:12:55.776464Z digest=sha256:4cdf1aa61d39e953f47753b116131d7a6a284474896b6dc43aff45d8daaa0b88