Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T05:20:04.678780Z
Paper Citation Record · LEDGER
As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.08352.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T05:20:04.678780Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-06T19:59:19.576331Z
A source-named dated measurement, never combined with another source.
Source: pith, observed 2026-08-06T19:59:20.245819Z
39 of 39 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 272ebcfe-1f8f-4e02-bb67-08c99c0226df · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a7f36aa9-93b8-4d49-9525-5d6b05948d17 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7b0d9c3d-2894-4745-b730-5bd98b02dded · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c4b84f46-e077-46a5-9db9-efc96c47e476 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Retrieval-Augmented Generation for Large Language Models: A Survey
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 00a963dc-3b13-4c79-bf6b-7b83bbf47d59 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Gemini: A Family of Highly Capable Multimodal Models
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8a1529fc-3e7b-4f6a-a4df-4bf54734bc29 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 16979356-ba25-461f-81cb-6f5e52cc047e · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8a8e6e81-d943-450e-baf7-51d84f854a4d · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2ac37695-4a6a-4568-9463-03073eb1f7fb · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4ec5092c-7c20-4a8d-938b-1ff96df223af · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fbffd299-bf73-4a6b-b182-a8d213c6a8c3 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation d38801c2-39f3-4180-9fc3-2f55b3c278c4 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6cf96254-e69d-4d87-9ec4-1dc36bfc518c · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Deduplicating Training Data Makes Language Models Better
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 68ab3260-0958-479b-a3f4-848fc9ad1db0 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation b305ec22-3d85-4cf9-bae8-e18f9d9e5705 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bf6c5fa1-85b2-49ab-a248-e5411c7e1338 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 140bbccf-e11a-4e24-9f65-cd7739fa9b46 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models An Agent Framework for Real-Time Financial Information Searching with Large Language Models
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 29a3fc8d-b524-49aa-9c0e-dda24b238923 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Search-o1: Agentic Search-Enhanced Large Reasoning Models
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 92813646-1c9e-4870-bf0b-c4dabd6bc7cc · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Crafting Knowledge: Exploring the Creative Mechanisms of Chat-Based Search Engines
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 84d25b17-e487-4b6f-8001-21af97ae0466 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 93168502-03f4-4ff0-9e39-87a3ed4056a7 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1db37f4f-5e60-43ea-8483-880d7b926626 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models GPT-4 Technical Report
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d6b3d568-d5de-423d-93eb-f0190a41f966 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Training language models to follow instructions with human feedback
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5ace5b02-7ace-44de-b839-4be17ea8c442 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Measuring and Narrowing the Compositionality Gap in Language Models
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7a63eac7-0af9-43ae-87a8-395eaed6e158 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a2ca605a-ff1c-4c0e-8ffb-51dfa1f49933 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 82dddd16-887a-4967-9bb8-4377fa39fb74 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c6895831-5c05-4759-82e2-952c8ab45ca1 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models ZeroSearch: Incentivize the Search Capability of LLMs without Searching
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3bd47fbc-bb17-42d7-afc0-afce38792520 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models LLaMA: Open and Efficient Foundation Language Models
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 150b7e48-c53d-4473-815b-245e98b49ee8 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d915ff67-fb9a-4f14-9b5a-c3f97672622c · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fc8604f5-90f4-402a-988e-f436b5baa48a · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 93df9836-5edd-4514-b5d5-c6b9338f4aa6 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models When Search Engine Services meet Large Language Models: Visions and Challenges
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ace32ffa-911a-472e-9669-47d599d66954 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Qwen2 Technical Report
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0c8aba97-b7ae-4c83-9258-e661802f1359 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a5857bf5-1679-4112-8ac8-d787cb100892 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Unresolved cited work
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 208ce99b-2e60-4612-9b81-7d5f48aca265 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models FinLLMs: A Framework for Financial Reasoning Dataset Generation with Large Language Models
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b3aa853c-7082-4071-a132-60f19e845ce3 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Retrieval-Augmented Generation for AI-Generated Content: A Survey
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 43e1e3da-6df7-4613-9874-9c0c20062979 · outbound
Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models Transactions of the Association for Computational Linguistics(2022)
Reference 2022
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fae78f6a-d1dc-4850-b8a7-8f1286e5ff64 · inbound
Evaluating the Effectiveness of Large Language Models in Solving Simple Programming Tasks: A User-Centered Study Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.