Pith. sign in

Paper Citation Record · LEDGER

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models

As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.08352.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.08352 v1

Coverage vector

measured 39 of 39 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:20:04.678780Z

measured 40 of 40 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T19:59:19.576331Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-06T19:59:20.245819Z

Reference resolution

39 of 39 outbound references displayed

  • verified exact3
  • verified fuzzy0
  • unresolved36
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 272ebcfe-1f8f-4e02-bb67-08c99c0226df · outbound

This paper cites an unresolved cited work.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.531101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.531101Z digest=sha256:b26a59dd3ffcd3d91809538464304120887eeef3bcec50275e12511dcc84cc98

Observation a7f36aa9-93b8-4d49-9525-5d6b05948d17 · outbound

This paper cites DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.535414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.535414Z digest=sha256:1ef980c68c05c2669e36d02e6d85bbb0ea69e037c1301178d9e76e83ca67aa48

Observation 7b0d9c3d-2894-4745-b730-5bd98b02dded · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.539838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.539838Z digest=sha256:6ed59ab3ecb99d9e99b116ad3004c334eb77886766dd45efebeb1ee192c80a7e

Observation c4b84f46-e077-46a5-9db9-efc96c47e476 · outbound

This paper cites Retrieval-Augmented Generation for Large Language Models: A Survey.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Retrieval-Augmented Generation for Large Language Models: A Survey

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.544162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.544162Z digest=sha256:6548e7ac8bf5c0bc70a7f1438a992900c2f6dd83b851e0ed9b4c1ee4681b9699

Observation 00a963dc-3b13-4c79-bf6b-7b83bbf47d59 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.548253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.548253Z digest=sha256:f3e73dc791502f64097cfed7f8d6af3e60946c8b89777e8264bff79da44d599a

Observation 8a1529fc-3e7b-4f6a-a4df-4bf54734bc29 · outbound

This paper cites an unresolved cited work.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:20:05.371417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:20:04.552150Z digest=sha256:0f9b5ad7b6865a8cb1f8e6ba77ef1b4549d479b18c6ac24a0392e5109b19b768

Observation 16979356-ba25-461f-81cb-6f5e52cc047e · outbound

This paper cites Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.556573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.556573Z digest=sha256:bccac8c21f51f7573a07d57b65bfb06ea892a721620b38a5074ee1cf62e569dd

Observation 8a8e6e81-d943-450e-baf7-51d84f854a4d · outbound

This paper cites MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.560765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.560765Z digest=sha256:782ce7df7fdc207899aed070c84cde49c4e313ffc9e450f8d3355332fa9da1cf

Observation 2ac37695-4a6a-4568-9463-03073eb1f7fb · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.565239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.565239Z digest=sha256:ecdba695ea70ff3282765b245d382292c1d50fb0c31e79496a679a9c47bd3ec5

Observation 4ec5092c-7c20-4a8d-938b-1ff96df223af · outbound

This paper cites TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.569002Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.569002Z digest=sha256:26470137b9a1f5a25f8f6e62a2e44f5ba1c6ef320123bff535966d0786f9bc9b

Observation fbffd299-bf73-4a6b-b182-a8d213c6a8c3 · outbound

This paper cites an unresolved cited work.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:20:05.358128Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:20:04.572796Z digest=sha256:ad59aec709f9948e0c2be9a7bf64ff874016b38110ee742eaa96441fcdb95b50

Observation d38801c2-39f3-4180-9fc3-2f55b3c278c4 · outbound

This paper cites RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.577187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.577187Z digest=sha256:c2c73a380fc27827f2cb1348237fdef4280db1d89fcbfc14b6a283fafccf0888

Observation 6cf96254-e69d-4d87-9ec4-1dc36bfc518c · outbound

This paper cites Deduplicating Training Data Makes Language Models Better.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Deduplicating Training Data Makes Language Models Better

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.580833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.580833Z digest=sha256:d8241fb8255597fba73c8d3217471f17a7c69abe5bd6172b2d15b0dd1d1ec36c

Observation 68ab3260-0958-479b-a3f4-848fc9ad1db0 · outbound

This paper cites an unresolved cited work.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:20:05.344557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:20:04.584536Z digest=sha256:7d6ff8d0e6fda5c5f4b399c263b8703a4b4288764b9382d2017a67a2e4abe8eb

Observation b305ec22-3d85-4cf9-bae8-e18f9d9e5705 · outbound

This paper cites Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.588178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.588178Z digest=sha256:a27c7f899c21a143b82f08397362c3ff80f3d125bef82096f446935d34b8c3f0

Observation bf6c5fa1-85b2-49ab-a248-e5411c7e1338 · outbound

This paper cites Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-07T05:20:04.997818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:20:04.591495Z digest=sha256:9928027e5b9af45783248c8ca7b05266954a9fe5f291a5ae8a7231e264726070

Observation 140bbccf-e11a-4e24-9f65-cd7739fa9b46 · outbound

This paper cites An Agent Framework for Real-Time Financial Information Searching with Large Language Models.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models An Agent Framework for Real-Time Financial Information Searching with Large Language Models

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-08-07T05:20:04.978818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:20:04.595188Z digest=sha256:e916468c91242e103f15aa7b9da69ecb1508349921a83b38cda556f677c745e8

Observation 29a3fc8d-b524-49aa-9c0e-dda24b238923 · outbound

This paper cites Search-o1: Agentic Search-Enhanced Large Reasoning Models.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Search-o1: Agentic Search-Enhanced Large Reasoning Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.598607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.598607Z digest=sha256:30c40bf730a3f4fb9ce4736cafab7b63e803a1bbba30784a5a7f7623e1b9ff3e

Observation 92813646-1c9e-4870-bf0b-c4dabd6bc7cc · outbound

This paper cites Crafting Knowledge: Exploring the Creative Mechanisms of Chat-Based Search Engines.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Crafting Knowledge: Exploring the Creative Mechanisms of Chat-Based Search Engines

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-08-07T05:20:04.945183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:20:04.602267Z digest=sha256:184acae7a7bd8decafc693293a383fcfec877b8aefebc3601dfd1e158b7add6b

Observation 84d25b17-e487-4b6f-8001-21af97ae0466 · outbound

This paper cites When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.606262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.606262Z digest=sha256:983fb4223c1fb119cec574719f53ffb1585f586d8c9b953f11f96029497ca286

Observation 93168502-03f4-4ff0-9e39-87a3ed4056a7 · outbound

This paper cites UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.610013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.610013Z digest=sha256:5b348b2daf6b34ae09b0ba8fbfa34ca1e3f9791ed8105a045c53bfbd90497297

Observation 1db37f4f-5e60-43ea-8483-880d7b926626 · outbound

This paper cites GPT-4 Technical Report.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models GPT-4 Technical Report

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.613476Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.613476Z digest=sha256:00c7aedec107d0fb7f6a05882eac7eb2bde1d8d046a3edab1289b93103113971

Observation d6b3d568-d5de-423d-93eb-f0190a41f966 · outbound

This paper cites Training language models to follow instructions with human feedback.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Training language models to follow instructions with human feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.616819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.616819Z digest=sha256:514d5ad5cd1097ddcd32f0523fb34a29d60f85fd6eb638d56f713e235cc1bd8e

Observation 5ace5b02-7ace-44de-b839-4be17ea8c442 · outbound

This paper cites Measuring and Narrowing the Compositionality Gap in Language Models.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Measuring and Narrowing the Compositionality Gap in Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.620506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.620506Z digest=sha256:0ccbd75e16f552d7c87491acd479da1f85923b3d9d3548119426bd8e351903ae

Observation 7a63eac7-0af9-43ae-87a8-395eaed6e158 · outbound

This paper cites an unresolved cited work.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.624214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.624214Z digest=sha256:35295fcea003c055840a50f540188dac1d0a04779d10c420a394ffc853c85f35

Observation a2ca605a-ff1c-4c0e-8ffb-51dfa1f49933 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.627721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.627721Z digest=sha256:3f6d92db253303e3251fc4bda011de90989221d98b39678407ce1a954a2f9d14

Observation 82dddd16-887a-4967-9bb8-4377fa39fb74 · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.631210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.631210Z digest=sha256:c731050a90f525595a258d5fbed31c1f7fdd268e1c711a68b496aa69ff1c8798

Observation c6895831-5c05-4759-82e2-952c8ab45ca1 · outbound

This paper cites ZeroSearch: Incentivize the Search Capability of LLMs without Searching.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models ZeroSearch: Incentivize the Search Capability of LLMs without Searching

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.635328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.635328Z digest=sha256:c0cc84b4f75f4a7c3082c52e147abc9a63221646c66220533b7c6898914ae933

Observation 3bd47fbc-bb17-42d7-afc0-afce38792520 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models LLaMA: Open and Efficient Foundation Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.639001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.639001Z digest=sha256:e2d3799e542c80677a28fa82ff670af4d61b749b65b9915e6a7b1ad5a65b6050

Observation 150b7e48-c53d-4473-815b-245e98b49ee8 · outbound

This paper cites an unresolved cited work.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.642718Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.642718Z digest=sha256:5b7b2333df0e5402ef11acacee5dba5e88efb17ec444c8bdce8ee7e3965edd0f

Observation d915ff67-fb9a-4f14-9b5a-c3f97672622c · outbound

This paper cites an unresolved cited work.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.650029Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.650029Z digest=sha256:d2fb7f5b8826787084f234aa13065f34f265f4f4d39317438c78b98ac854c717

Observation fc8604f5-90f4-402a-988e-f436b5baa48a · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.654413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.654413Z digest=sha256:08fb7d132695369733361299d6a9ed03eff99c1e67b996700f4ec5e30c8ec14e

Observation 93df9836-5edd-4514-b5d5-c6b9338f4aa6 · outbound

This paper cites When Search Engine Services meet Large Language Models: Visions and Challenges.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models When Search Engine Services meet Large Language Models: Visions and Challenges

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.658459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.658459Z digest=sha256:4c10b759cd1905398d595aa73cff299d73b541964e1069908d03f1b5adc14a42

Observation ace32ffa-911a-472e-9669-47d599d66954 · outbound

This paper cites Qwen2 Technical Report.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Qwen2 Technical Report

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.663082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.663082Z digest=sha256:03aa54d5e3a815d42033e7c7438fecce3743134a0e0cb66f957742f8d5bab4a5

Observation 0c8aba97-b7ae-4c83-9258-e661802f1359 · outbound

This paper cites Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.667236Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.667236Z digest=sha256:d940fb18900b9ad322fac564f338994f97809c1f74d1bbbbe19b0f28fd9c07e7

Observation a5857bf5-1679-4112-8ac8-d787cb100892 · outbound

This paper cites an unresolved cited work.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:20:05.313265Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:20:04.671582Z digest=sha256:1a1774e86fcdf8d9e70fcfb94751f01743cab7f43e25e79d12171bc272edf584

Observation 208ce99b-2e60-4612-9b81-7d5f48aca265 · outbound

This paper cites FinLLMs: A Framework for Financial Reasoning Dataset Generation with Large Language Models.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models FinLLMs: A Framework for Financial Reasoning Dataset Generation with Large Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.675057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.675057Z digest=sha256:a99df4f8e9dde1bdc7f0da12d21b3e6640b97d9a9c766b7082791f5427fc1e31

Observation b3aa853c-7082-4071-a132-60f19e845ce3 · outbound

This paper cites Retrieval-Augmented Generation for AI-Generated Content: A Survey.

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Retrieval-Augmented Generation for AI-Generated Content: A Survey

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.678780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.678780Z digest=sha256:4a1dc89b86e4bc9803674cca2375e9dbbe11e3f80604463cedb35ed0700130db

Observation 43e1e3da-6df7-4613-9874-9c0c20062979 · outbound

This paper cites Transactions of the Association for Computational Linguistics(2022).

Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Transactions of the Association for Computational Linguistics(2022)

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T05:20:04.646409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:20:04.646409Z digest=sha256:0c13b4d5122e4a9c70e4b176b719199edb40897793dfc935f443cff598888d8f

Pith citing papers

Observation fae78f6a-d1dc-4850-b8a7-8f1286e5ff64 · inbound

Evaluating the Effectiveness of Large Language Models in Solving Simple Programming Tasks: A User-Centered Study cites this paper.

Evaluating the Effectiveness of Large Language Models in Solving Simple Programming Tasks: A User-Centered Study Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-08-06T19:59:20.466605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T19:59:19.576331Z digest=sha256:1665481dfdfc4ddb8405fe7465e2d1d6ec7d393e230122eeefb30db61ddb2b8d