{"as_of":"2026-08-08T05:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47275bd47a2b182e909dc8cdeedac8f1adef8312f0a262fd2ee91c6a2aa48417","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:20:04.678780Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:59:19.576331Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:59:20.245819Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.08352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08352","snapshot_observed_at":"2026-08-06T19:59:20.245819Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","venue":"cs.IR","work_id":"739aae79-89cd-4103-bf05-291e10393797","year":2025},"citing_paper":{"arxiv_id":"2507.04043","last_updated":"2025-07-05T13:52:31Z","snapshot_observed_at":"2026-08-07T10:29:08.889925Z","submitted_at":"2025-07-05T13:52:31Z","title":"Evaluating the Effectiveness of Large Language Models in Solving Simple Programming Tasks: A User-Centered Study","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:19.576331Z"},"links":{"cited_paper":"/paper/2506.08352","citing_paper":"/paper/2507.04043"},"observation_digest":"sha256:1665481dfdfc4ddb8405fe7465e2d1d6ec7d393e230122eeefb30db61ddb2b8d","observation_id":"fae78f6a-d1dc-4850-b8a7-8f1286e5ff64","resolution":{"observed_at":"2026-08-06T19:59:20.466605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08352/citation-record","integrity":"/paper/2506.08352/integrity","json":"/paper/2506.08352/citation-record.json","paper":"/paper/2506.08352"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:04.531101Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.531101Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:b26a59dd3ffcd3d91809538464304120887eeef3bcec50275e12511dcc84cc98","observation_id":"272ebcfe-1f8f-4e02-bb67-08c99c0226df","resolution":{"observed_at":"2026-08-07T05:20:04.531101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T05:20:04.535414Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.535414Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:1ef980c68c05c2669e36d02e6d85bbb0ea69e037c1301178d9e76e83ca67aa48","observation_id":"a7f36aa9-93b8-4d49-9525-5d6b05948d17","resolution":{"observed_at":"2026-08-07T05:20:04.535414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:20:04.539838Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.539838Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:6ed59ab3ecb99d9e99b116ad3004c334eb77886766dd45efebeb1ee192c80a7e","observation_id":"7b0d9c3d-2894-4745-b730-5bd98b02dded","resolution":{"observed_at":"2026-08-07T05:20:04.539838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T05:20:04.544162Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.544162Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:6548e7ac8bf5c0bc70a7f1438a992900c2f6dd83b851e0ed9b4c1ee4681b9699","observation_id":"c4b84f46-e077-46a5-9db9-efc96c47e476","resolution":{"observed_at":"2026-08-07T05:20:04.544162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:20:04.548253Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.548253Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:f3e73dc791502f64097cfed7f8d6af3e60946c8b89777e8264bff79da44d599a","observation_id":"00a963dc-3b13-4c79-bf6b-7b83bbf47d59","resolution":{"observed_at":"2026-08-07T05:20:04.548253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:05.367194Z","title":null,"venue":null,"work_id":"3f19d827-6411-4334-a966-7c5e0e744954","year":1979},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.552150Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:0f9b5ad7b6865a8cb1f8e6ba77ef1b4549d479b18c6ac24a0392e5109b19b768","observation_id":"8a1529fc-3e7b-4f6a-a4df-4bf54734bc29","resolution":{"observed_at":"2026-08-07T05:20:05.371417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-07T05:20:04.556573Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.556573Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:bccac8c21f51f7573a07d57b65bfb06ea892a721620b38a5074ee1cf62e569dd","observation_id":"16979356-ba25-461f-81cb-6f5e52cc047e","resolution":{"observed_at":"2026-08-07T05:20:04.556573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12959","last_updated":"2024-11-27T08:49:12Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:45Z","title":"MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12959","snapshot_observed_at":"2026-08-07T05:20:04.560765Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.560765Z"},"links":{"cited_paper":"/paper/2409.12959","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:782ce7df7fdc207899aed070c84cde49c4e313ffc9e450f8d3355332fa9da1cf","observation_id":"8a8e6e81-d943-450e-baf7-51d84f854a4d","resolution":{"observed_at":"2026-08-07T05:20:04.560765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T05:20:04.565239Z","title":"Search-r1:Trainingllmstoreasonandlever- age search engines with reinforcement learning.arXiv preprint arXiv:2503.09516 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.565239Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:ecdba695ea70ff3282765b245d382292c1d50fb0c31e79496a679a9c47bd3ec5","observation_id":"2ac37695-4a6a-4568-9463-03073eb1f7fb","resolution":{"observed_at":"2026-08-07T05:20:04.565239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-07T05:20:04.569002Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.569002Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:26470137b9a1f5a25f8f6e62a2e44f5ba1c6ef320123bff535966d0786f9bc9b","observation_id":"4ec5092c-7c20-4a8d-938b-1ff96df223af","resolution":{"observed_at":"2026-08-07T05:20:04.569002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:05.353615Z","title":null,"venue":null,"work_id":"c4d9837d-80ac-45e7-9731-f4bdb77c7b85","year":2019},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.572796Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:ad59aec709f9948e0c2be9a7bf64ff874016b38110ee742eaa96441fcdb95b50","observation_id":"fbffd299-bf73-4a6b-b182-a8d213c6a8c3","resolution":{"observed_at":"2026-08-07T05:20:05.358128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-07T05:20:04.577187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.577187Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:c2c73a380fc27827f2cb1348237fdef4280db1d89fcbfc14b6a283fafccf0888","observation_id":"d38801c2-39f3-4180-9fc3-2f55b3c278c4","resolution":{"observed_at":"2026-08-07T05:20:04.577187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-07T05:20:04.580833Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.580833Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:d8241fb8255597fba73c8d3217471f17a7c69abe5bd6172b2d15b0dd1d1ec36c","observation_id":"6cf96254-e69d-4d87-9ec4-1dc36bfc518c","resolution":{"observed_at":"2026-08-07T05:20:04.580833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:05.340710Z","title":null,"venue":null,"work_id":"6b54647b-84e8-4717-9ab6-a94473c6f875","year":2020},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.584536Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:7d6ff8d0e6fda5c5f4b399c263b8703a4b4288764b9382d2017a67a2e4abe8eb","observation_id":"68ab3260-0958-479b-a3f4-848fc9ad1db0","resolution":{"observed_at":"2026-08-07T05:20:05.344557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-07T05:20:04.588178Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.588178Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:a27c7f899c21a143b82f08397362c3ff80f3d125bef82096f446935d34b8c3f0","observation_id":"b305ec22-3d85-4cf9-bae8-e18f9d9e5705","resolution":{"observed_at":"2026-08-07T05:20:04.588178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18831","last_updated":"2025-05-24T19:00:36Z","snapshot_observed_at":"2026-08-07T15:06:24.787553Z","submitted_at":"2025-05-24T19:00:36Z","title":"Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18831","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18831","snapshot_observed_at":"2026-08-07T05:20:04.993495Z","title":"Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning","venue":"cs.IR","work_id":"840e871c-fdd5-4a1e-a28c-8ca473d8a2e7","year":2025},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.591495Z"},"links":{"cited_paper":"/paper/2505.18831","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:9928027e5b9af45783248c8ca7b05266954a9fe5f291a5ae8a7231e264726070","observation_id":"bf6c5fa1-85b2-49ab-a248-e5411c7e1338","resolution":{"observed_at":"2026-08-07T05:20:04.997818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15684","last_updated":"2024-12-14T07:26:39Z","snapshot_observed_at":"2026-07-06T20:40:34.378362Z","submitted_at":"2024-12-14T07:26:39Z","title":"An Agent Framework for Real-Time Financial Information Searching with Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.15684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15684","snapshot_observed_at":"2026-08-07T05:20:04.974726Z","title":"An Agent Framework for Real-Time Financial Information Searching with Large Language Models","venue":"cs.IR","work_id":"bd96de9d-60a0-4f5e-a1a8-49fe5892df76","year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.595188Z"},"links":{"cited_paper":"/paper/2502.15684","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:e916468c91242e103f15aa7b9da69ecb1508349921a83b38cda556f677c745e8","observation_id":"140bbccf-e11a-4e24-9f65-cd7739fa9b46","resolution":{"observed_at":"2026-08-07T05:20:04.978818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-07T05:20:04.598607Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.598607Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:30c40bf730a3f4fb9ce4736cafab7b63e803a1bbba30784a5a7f7623e1b9ff3e","observation_id":"29a3fc8d-b524-49aa-9c0e-dda24b238923","resolution":{"observed_at":"2026-08-07T05:20:04.598607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19421","last_updated":"2024-02-29T18:20:37Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:20:37Z","title":"Crafting Knowledge: Exploring the Creative Mechanisms of Chat-Based Search Engines","version":1},"cited_work":{"arxiv_id":"2402.19421","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.19421","snapshot_observed_at":"2026-08-07T05:20:04.938854Z","title":"Crafting Knowledge: Exploring the Creative Mechanisms of Chat-Based Search Engines","venue":"cs.IR","work_id":"04ebaccd-932a-456c-a8c7-71f35deb10db","year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.602267Z"},"links":{"cited_paper":"/paper/2402.19421","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:184acae7a7bd8decafc693293a383fcfec877b8aefebc3601dfd1e158b7add6b","observation_id":"92813646-1c9e-4870-bf0b-c4dabd6bc7cc","resolution":{"observed_at":"2026-08-07T05:20:04.945183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-08-07T05:20:04.606262Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.606262Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:983fb4223c1fb119cec574719f53ffb1585f586d8c9b953f11f96029497ca286","observation_id":"84d25b17-e487-4b6f-8001-21af97ae0466","resolution":{"observed_at":"2026-08-07T05:20:04.606262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-07T05:20:04.610013Z","title":"McInnes, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.610013Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:5b348b2daf6b34ae09b0ba8fbfa34ca1e3f9791ed8105a045c53bfbd90497297","observation_id":"93168502-03f4-4ff0-9e39-87a3ed4056a7","resolution":{"observed_at":"2026-08-07T05:20:04.610013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:20:04.613476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.613476Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:00c7aedec107d0fb7f6a05882eac7eb2bde1d8d046a3edab1289b93103113971","observation_id":"1db37f4f-5e60-43ea-8483-880d7b926626","resolution":{"observed_at":"2026-08-07T05:20:04.613476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:20:04.616819Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.616819Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:514d5ad5cd1097ddcd32f0523fb34a29d60f85fd6eb638d56f713e235cc1bd8e","observation_id":"d6b3d568-d5de-423d-93eb-f0190a41f966","resolution":{"observed_at":"2026-08-07T05:20:04.616819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-07-31T15:52:06.089691Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-07T05:20:04.620506Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.620506Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:0ccbd75e16f552d7c87491acd479da1f85923b3d9d3548119426bd8e351903ae","observation_id":"5ace5b02-7ace-44de-b839-4be17ea8c442","resolution":{"observed_at":"2026-08-07T05:20:04.620506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:04.624214Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.624214Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:35295fcea003c055840a50f540188dac1d0a04779d10c420a394ffc853c85f35","observation_id":"7a63eac7-0af9-43ae-87a8-395eaed6e158","resolution":{"observed_at":"2026-08-07T05:20:04.624214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:20:04.627721Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.627721Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:3f6d92db253303e3251fc4bda011de90989221d98b39678407ce1a954a2f9d14","observation_id":"a2ca605a-ff1c-4c0e-8ffb-51dfa1f49933","resolution":{"observed_at":"2026-08-07T05:20:04.627721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T05:20:04.631210Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.631210Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:c731050a90f525595a258d5fbed31c1f7fdd268e1c711a68b496aa69ff1c8798","observation_id":"82dddd16-887a-4967-9bb8-4377fa39fb74","resolution":{"observed_at":"2026-08-07T05:20:04.631210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-07T05:20:04.635328Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.635328Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:c0cc84b4f75f4a7c3082c52e147abc9a63221646c66220533b7c6898914ae933","observation_id":"c6895831-5c05-4759-82e2-952c8ab45ca1","resolution":{"observed_at":"2026-08-07T05:20:04.635328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:20:04.639001Z","title":"LLaMA:OpenandEfficientFoundation Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.639001Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:e2d3799e542c80677a28fa82ff670af4d61b749b65b9915e6a7b1ad5a65b6050","observation_id":"3bd47fbc-bb17-42d7-afc0-afce38792520","resolution":{"observed_at":"2026-08-07T05:20:04.639001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:04.642718Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.642718Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:5b7b2333df0e5402ef11acacee5dba5e88efb17ec444c8bdce8ee7e3965edd0f","observation_id":"150b7e48-c53d-4473-815b-245e98b49ee8","resolution":{"observed_at":"2026-08-07T05:20:04.642718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:04.650029Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.650029Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:d2fb7f5b8826787084f234aa13065f34f265f4f4d39317438c78b98ac854c717","observation_id":"d915ff67-fb9a-4f14-9b5a-c3f97672622c","resolution":{"observed_at":"2026-08-07T05:20:04.650029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T05:20:04.654413Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.654413Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:08fb7d132695369733361299d6a9ed03eff99c1e67b996700f4ec5e30c8ec14e","observation_id":"fc8604f5-90f4-402a-988e-f436b5baa48a","resolution":{"observed_at":"2026-08-07T05:20:04.654413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00128","last_updated":"2024-06-28T03:52:13Z","snapshot_observed_at":"2026-08-04T02:09:59.170120Z","submitted_at":"2024-06-28T03:52:13Z","title":"When Search Engine Services meet Large Language Models: Visions and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00128","snapshot_observed_at":"2026-08-07T05:20:04.658459Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.658459Z"},"links":{"cited_paper":"/paper/2407.00128","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:4c10b759cd1905398d595aa73cff299d73b541964e1069908d03f1b5adc14a42","observation_id":"93df9836-5edd-4514-b5d5-c6b9338f4aa6","resolution":{"observed_at":"2026-08-07T05:20:04.658459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:20:04.663082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.663082Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:03aa54d5e3a815d42033e7c7438fecce3743134a0e0cb66f957742f8d5bab4a5","observation_id":"ace32ffa-911a-472e-9669-47d599d66954","resolution":{"observed_at":"2026-08-07T05:20:04.663082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12065","last_updated":"2025-05-17T16:07:01Z","snapshot_observed_at":"2026-08-07T15:43:49.894744Z","submitted_at":"2025-05-17T16:07:01Z","title":"Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12065","snapshot_observed_at":"2026-08-07T05:20:04.667236Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.667236Z"},"links":{"cited_paper":"/paper/2505.12065","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:d940fb18900b9ad322fac564f338994f97809c1f74d1bbbbe19b0f28fd9c07e7","observation_id":"0c8aba97-b7ae-4c83-9258-e661802f1359","resolution":{"observed_at":"2026-08-07T05:20:04.667236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:05.308777Z","title":null,"venue":null,"work_id":"844ba0c3-d94a-42c8-8985-c0962b772f66","year":2018},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.671582Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:1a1774e86fcdf8d9e70fcfb94751f01743cab7f43e25e79d12171bc272edf584","observation_id":"a5857bf5-1679-4112-8ac8-d787cb100892","resolution":{"observed_at":"2026-08-07T05:20:05.313265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10744","last_updated":"2024-01-19T15:09:39Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:09:39Z","title":"FinLLMs: A Framework for Financial Reasoning Dataset Generation with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10744","snapshot_observed_at":"2026-08-07T05:20:04.675057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.675057Z"},"links":{"cited_paper":"/paper/2401.10744","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:a99df4f8e9dde1bdc7f0da12d21b3e6640b97d9a9c766b7082791f5427fc1e31","observation_id":"208ce99b-2e60-4612-9b81-7d5f48aca265","resolution":{"observed_at":"2026-08-07T05:20:04.675057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19473","last_updated":"2024-06-21T08:26:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:59:01Z","title":"Retrieval-Augmented Generation for AI-Generated Content: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19473","snapshot_observed_at":"2026-08-07T05:20:04.678780Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.678780Z"},"links":{"cited_paper":"/paper/2402.19473","citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:4a1dc89b86e4bc9803674cca2375e9dbbe11e3f80604463cedb35ed0700130db","observation_id":"b3aa853c-7082-4071-a132-60f19e845ce3","resolution":{"observed_at":"2026-08-07T05:20:04.678780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:04.646409Z","title":"Transactions of the Association for Computational Linguistics(2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:04.646409Z"},"links":{"citing_paper":"/paper/2506.08352"},"observation_digest":"sha256:0c13b4d5122e4a9c70e4b176b719199edb40897793dfc935f443cff598888d8f","observation_id":"43e1e3da-6df7-4613-9874-9c0c20062979","resolution":{"observed_at":"2026-08-07T05:20:04.646409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08352","last_updated":"2025-06-10T02:09:57Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-07T10:30:38.151886Z","submitted_at":"2025-06-10T02:09:57Z","title":"Reinforcement Fine-Tuning for Reasoning towards Multi-Step Multi-Source Search in Large Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.08352."}