{"as_of":"2026-08-08T16:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:342e5c2619001361d2aec8d9324503f8e20f4915dbac8abeb42bca6ecccd6821","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:54:30.541560Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:12:12.793725Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:19:38.663842Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-05T21:12:12.793725Z","title":"R-search: Empowering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09303","last_updated":"2025-08-12T19:38:21Z","snapshot_observed_at":"2026-08-07T12:04:31.853290Z","submitted_at":"2025-08-12T19:38:21Z","title":"ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T21:12:12.793725Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2508.09303"},"observation_digest":"sha256:86d724a1041b53ecaa52eedbb3a35a9b326d2b4db0f56300db813da1e3e6020e","observation_id":"a035ada7-ce11-4bbb-8836-820e9b7b309f","resolution":{"observed_at":"2026-08-05T21:12:12.793725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2510.00861","last_updated":"2026-04-20T08:17:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T13:10:36Z","title":"Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T11:06:20.058342Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2510.00861"},"observation_digest":"sha256:e8ad0f8095bf5455bbfdc61f5ecb3d31e014254ee4e3de60bf805eb86a070232","observation_id":"e1aa069b-9b7b-46a1-aba8-ddf010ed2d6b","resolution":{"observed_at":"2026-05-18T11:11:18.237838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2510.11122","last_updated":"2026-04-04T06:08:34Z","snapshot_observed_at":"2026-08-06T00:49:59.952705Z","submitted_at":"2025-10-13T08:08:59Z","title":"Learning to Trust: Dynamic Utilization of Retrieval-Augmented Generation for E-commerce Search Relevance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T08:06:23.479875Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2510.11122"},"observation_digest":"sha256:f4de57c48904ccb61dfa572272467dc2aae6dbecb60aa35efef588dcbc4e235a","observation_id":"a70854fa-5586-4614-b096-b05e0ba3d765","resolution":{"observed_at":"2026-05-18T08:11:07.182204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-04T09:50:51.764147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13272","last_updated":"2026-06-03T06:16:13Z","snapshot_observed_at":"2026-08-06T23:18:23.213942Z","submitted_at":"2025-10-15T08:17:52Z","title":"Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-04T09:50:51.764147Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2510.13272"},"observation_digest":"sha256:6a6d0f38c29e4f32fc921693d36f37ba745b7ddb7bd17ba4ea44a4f91f6231a7","observation_id":"6f35d705-251a-4281-a182-3841362f4f59","resolution":{"observed_at":"2026-08-04T09:50:51.764147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2605.06285","last_updated":"2026-05-07T13:56:13Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:56:13Z","title":"LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T10:27:00.257353Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.06285"},"observation_digest":"sha256:3849e4ef78c371b2408c75e7337177f2df7954c8a2f997028dfe49de43d7b612","observation_id":"84164662-8da3-46e0-b4b5-be266237471d","resolution":{"observed_at":"2026-05-11T20:01:12.182325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2605.10923","last_updated":"2026-05-17T05:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:55:13Z","title":"Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T03:45:06.199636Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.10923"},"observation_digest":"sha256:f0ba938a8b155f98b955709a324cf378ad289f08044a0267f1f4e9535a93e0af","observation_id":"7f9edbd2-78df-4063-88ba-511dbfaa9a57","resolution":{"observed_at":"2026-05-12T07:06:33.516677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2605.10923","last_updated":"2026-05-17T05:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:55:13Z","title":"Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T22:19:49.016156Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.10923"},"observation_digest":"sha256:7a492070caff282959efb99dd3e0f0b578d58d6d014947006f94f0d5d5442a96","observation_id":"a8f2398a-4187-4976-af04-f952f24d8fdf","resolution":{"observed_at":"2026-05-20T22:23:48.394171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2605.27860","last_updated":"2026-08-03T08:40:06Z","snapshot_observed_at":"2026-08-06T23:31:06.558801Z","submitted_at":"2026-05-27T02:20:21Z","title":"C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T12:43:58.323948Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.27860"},"observation_digest":"sha256:113c3e68d6609810e0298bf9f1952d7a213920bb8892715df622c7b2c9b1fa49","observation_id":"8c269676-9853-4254-ae24-6187fab04f09","resolution":{"observed_at":"2026-06-29T12:53:27.006970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-04T05:01:11.073781Z","title":"Qiaoyu Zheng, Yuze Sun, Chaoyi Wu, Weike Zhao, Pengcheng Qiu, Yongguo Yu, Kun Sun, Jian Zhang, Yanfeng Wang, Ya Zhang, and 1 others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27860","last_updated":"2026-08-03T08:40:06Z","snapshot_observed_at":"2026-08-06T23:31:06.558801Z","submitted_at":"2026-05-27T02:20:21Z","title":"C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T05:01:11.073781Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.27860"},"observation_digest":"sha256:83e8592789eeffd49208cb80629d287d83f30ffc8ab1d7552bf152c5d6d770c1","observation_id":"48e413c0-87bf-409f-9bd6-e0dcad6295ec","resolution":{"observed_at":"2026-08-04T05:01:11.073781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-02T20:51:48.133765Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:50.123077Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2606.21262"},"observation_digest":"sha256:17d55111cb6bd5bcb027c1760dcacf4984abf0a6c99116df5eafc1de654749dd","observation_id":"ff0c6177-c78e-43ad-b05b-23eb7ce5d77b","resolution":{"observed_at":"2026-07-04T06:19:38.665573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-02T10:43:55.436888Z","title":"R-search: Empowering llm reasoning with search via multi-reward reinforcement learning.arXiv preprint arXiv:2506.04185,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-02T20:51:48.133765Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T10:43:55.436888Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2606.21262"},"observation_digest":"sha256:879b673b8208742dc830b505af1b9c77a11877d22a158a24d8432d69ee0531a3","observation_id":"018f5e59-856c-457f-8186-0402c437d89f","resolution":{"observed_at":"2026-08-02T10:43:55.436888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2606.26122","last_updated":"2026-05-27T21:21:42Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T21:21:42Z","title":"DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-29T12:50:16.625077Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2606.26122"},"observation_digest":"sha256:c3215d943556c6e07182a8230535372e7eb19ac342aff86694baf8865981ccb0","observation_id":"0ee5da9b-6551-4441-a027-aeaa9de77755","resolution":{"observed_at":"2026-06-29T12:53:26.535103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-01T13:54:23.891567Z","title":"arXiv preprint arXiv:2506.04185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18979","last_updated":"2026-07-21T11:14:33Z","snapshot_observed_at":"2026-08-06T13:13:54.204332Z","submitted_at":"2026-07-21T11:14:33Z","title":"Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T13:54:23.891567Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2607.18979"},"observation_digest":"sha256:6b8a4a39bf76ff0ea5e5de409d921ef8918163b6b9254f78c336fb0f4b5833ed","observation_id":"4edeba9a-bc41-4575-8bbc-4c477388e225","resolution":{"observed_at":"2026-08-01T13:54:23.891567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-04T15:12:55.776464Z","title":"2025 , archivePrefix =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-07T22:15:33.180420Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.776464Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:4cdf1aa61d39e953f47753b116131d7a6a284474896b6dc43aff45d8daaa0b88","observation_id":"3e83d5df-5c7a-45e8-9376-d24c1ef67354","resolution":{"observed_at":"2026-08-04T15:12:55.776464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04185/citation-record","integrity":"/paper/2506.04185/integrity","json":"/paper/2506.04185/citation-record.json","paper":"/paper/2506.04185"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.499","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.009280Z","title":null,"venue":null,"work_id":"03992c65-547e-4d18-94f3-20d6afa8a0b7","year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.274335Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:cb4d3bb378b20fac164acf8bb573acc341187a03916ccb11ff8056de2dc3b320","observation_id":"fbdc3536-4226-4620-aa14-1d80f49ea013","resolution":{"observed_at":"2026-08-07T10:54:31.014255Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.280264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.280264Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:07a4d01f6d52e5a299ccf25629698892544ca9809619684d95ec7eb53afeb039","observation_id":"c155b641-b8d7-4924-8234-4a2ea31e74bf","resolution":{"observed_at":"2026-08-07T10:54:30.280264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.433342Z","title":null,"venue":null,"work_id":"f7e2157c-1259-47f6-833a-fb2298a94a47","year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.285547Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:6663afe727ff6ef495e848ef31dc63dd2886a15b862b735e78c7f3248d3f586e","observation_id":"728e8402-de64-4bb0-9f16-18a2cbdb3567","resolution":{"observed_at":"2026-08-07T10:54:31.438391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00610","last_updated":"2024-03-31T08:58:54Z","snapshot_observed_at":"2026-08-07T00:34:30.401578Z","submitted_at":"2024-03-31T08:58:54Z","title":"RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00610","snapshot_observed_at":"2026-08-07T10:54:30.291283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.291283Z"},"links":{"cited_paper":"/paper/2404.00610","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:e081ea64df0416189bb775613781a7b8e8659c50b6f2c10f2cc76c01eb173903","observation_id":"f14615f3-bf2f-4d9f-a4a3-038dbcb03f25","resolution":{"observed_at":"2026-08-07T10:54:30.291283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.417296Z","title":null,"venue":null,"work_id":"0076eaf5-ad9b-4b0b-b280-a1500d7bf26b","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.296904Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:8a949e9db8f706de316434b8c7a3c12187bf18b8a05bb69f345bedd95bb770f5","observation_id":"0458c6c1-fb1a-4acc-99d6-97775c449014","resolution":{"observed_at":"2026-08-07T10:54:31.422082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.399571Z","title":null,"venue":null,"work_id":"365ee559-c62a-42d1-bfae-81ce2c9a7dbc","year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.302594Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:f3dea961ae81d3dbc6ef0531b15fc060117a17bd02276f0f650fe4a2ffb5f17d","observation_id":"ea1ee574-c118-4222-b4dd-7a7a6fd9f773","resolution":{"observed_at":"2026-08-07T10:54:31.405352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:54:30.308393Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.308393Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:bee01d9363b54f98f612d98333806a970b841ade2566065120ad5709e7c37ec4","observation_id":"b5b447c7-48d1-455a-bb56-c6389374d78c","resolution":{"observed_at":"2026-08-07T10:54:30.308393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T10:54:30.313372Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.313372Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:9bd66036e4fd952bafb3474bdcafca42bac1126ae4467503d8f703bd7602f170","observation_id":"e4d27694-6d90-4eab-b4c9-3dfd99f42d05","resolution":{"observed_at":"2026-08-07T10:54:30.313372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01142","last_updated":"2025-06-08T17:17:01Z","snapshot_observed_at":"2026-07-06T20:30:08.210991Z","submitted_at":"2025-02-03T08:22:45Z","title":"DeepRAG: Thinking to Retrieve Step by Step for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01142","snapshot_observed_at":"2026-08-07T10:54:30.319046Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.319046Z"},"links":{"cited_paper":"/paper/2502.01142","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:b99803e84aa8fa57a8a3c51d1c515b5c390dd1ba64577979dead8a26a883a136","observation_id":"aefe27e4-2382-442a-85b2-ee35c1f8f2b1","resolution":{"observed_at":"2026-08-07T10:54:30.319046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:54:30.324627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.324627Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:7bcf26eca9831fa7c3418f13bdcc86940794ec137ff24158886f772a119dc415","observation_id":"3dae0aa0-caff-4bfd-a084-1803c332fe30","resolution":{"observed_at":"2026-08-07T10:54:30.324627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-08-07T10:54:30.330000Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.330000Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:e08ae8156d053f667358d5a3d8c9c63eeae0705a29dc40be1512d37554623445","observation_id":"a2117c3f-9435-42da-923f-427d56c31482","resolution":{"observed_at":"2026-08-07T10:54:30.330000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.338794Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.338794Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:cdf829d6d0a02464ca22c7bc5a07e4e81732c1a95f2b13c675905a4b824f4646","observation_id":"f8cb34d6-2812-41e1-bfc2-cf3f690c9db6","resolution":{"observed_at":"2026-08-07T10:54:30.338794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T10:54:30.344581Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.344581Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:e3cb1aef4b09e3568b5842bb2821236a893d4a956a7c61848ba9ce2cb4e3d8e0","observation_id":"7f6099d7-897f-4297-ab19-3e0e65e07534","resolution":{"observed_at":"2026-08-07T10:54:30.344581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.350126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.350126Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:52ecca1a514707fc61bcc894f7071f9b3e5f23c4598b7830c72898596ffa1ed7","observation_id":"408e75e1-1756-4072-9b89-bcf8d9d25e38","resolution":{"observed_at":"2026-08-07T10:54:30.350126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.355185Z","title":"Xu, Luyu Gao, Zhiqing Sun, Qian Liu, Jane Dwivedi - Yu, Yiming Yang, Jamie Callan, and Graham Neubig","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.355185Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:383810ef46ddbb4c16d16fc72b92fdcf735021b0d913cb9d80852d90bb946473","observation_id":"52555175-f859-48d1-9c71-24b6822bb064","resolution":{"observed_at":"2026-08-07T10:54:30.355185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T10:54:30.360587Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.360587Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:203bb9f1b679e8edfabf811337320147f5c417975792f37c1ff86edc73ea488e","observation_id":"c274fb56-4c2b-4edd-af2c-0b8fb4f8b6e6","resolution":{"observed_at":"2026-08-07T10:54:30.360587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13576","last_updated":"2025-02-24T02:46:52Z","snapshot_observed_at":"2026-08-08T09:22:36.004067Z","submitted_at":"2024-05-22T12:12:40Z","title":"FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13576","snapshot_observed_at":"2026-08-07T10:54:30.366802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.366802Z"},"links":{"cited_paper":"/paper/2405.13576","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:4c75a851badb09eda51a76fbf86cfc0cc36877f0007d115b783e1e439ccf02f6","observation_id":"9c9dacb0-3a3c-45a9-854f-ae11ede5480e","resolution":{"observed_at":"2026-08-07T10:54:30.366802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.372406Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.372406Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:911dd037e6d78fb1cf3853232dcbdc39599bf52e1851cfdad5fef5bd5e68d2c1","observation_id":"627dcc3a-6959-49c1-b1bf-f05d5267f601","resolution":{"observed_at":"2026-08-07T10:54:30.372406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.377138Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.377138Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:4922b0025432f70f06c8bf35eb23e810c3a5aca185f9133c639bd7f8491219cd","observation_id":"20bd6a40-5b96-4d90-a4ef-8a52550e4607","resolution":{"observed_at":"2026-08-07T10:54:30.377138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.382234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.382234Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:c9af22bf515c9818f7d821b2f1b9bcd1499f78477cc45d9497400c12ab792235","observation_id":"2c522333-8a80-4eb4-8078-4b876b79c84a","resolution":{"observed_at":"2026-08-07T10:54:30.382234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T10:54:30.386949Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.386949Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:a70f595eeafa10f2edc2c157462c6b6d8aeeb362b160930e1818221022c3a978","observation_id":"17d2ab95-057d-402f-9bee-7ed50560ea97","resolution":{"observed_at":"2026-08-07T10:54:30.386949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.396880Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.396880Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:1bcea42c0669588fcb2f0215a770b28a3c2b0dd440dc709922403e15b81abc3c","observation_id":"ca83f98c-38fb-4070-ab48-be9fd457c959","resolution":{"observed_at":"2026-08-07T10:54:30.396880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.402416Z","title":"u ttler, Mike Lewis, Wen - tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.402416Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:7babcac8e6b9ce0db61d5da49e1587e600a2d93b933de2ae040de48d49d2fc92","observation_id":"3a196208-39d9-4970-9db7-a4b97e708d13","resolution":{"observed_at":"2026-08-07T10:54:30.402416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.407013Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.407013Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:444a1f96156d986ed5fa692691bd8fe9d5d5c2f9f8724f200794486da41fe3b0","observation_id":"46fda872-3ffb-4558-a455-605f44d7e1c4","resolution":{"observed_at":"2026-08-07T10:54:30.407013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.346276Z","title":null,"venue":null,"work_id":"8302ec2e-c328-4c6c-8cdb-145b793f310c","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.411984Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:3cb60ae34d80fe83c2ed2cf3c1a624aece56f9e570e064719461795af128dc63","observation_id":"c433b464-ea9f-4427-b624-05adb958da6f","resolution":{"observed_at":"2026-08-07T10:54:31.352675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.328867Z","title":null,"venue":null,"work_id":"3d2d2ec1-75e2-40d5-a2be-118bedcae7f5","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.417627Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:be4d24c230b7ce371ae32015c31e21cebd31b51bb7f38e3cb22bb158615a906f","observation_id":"c24b190f-2bfa-4b03-aadd-3d8b7aed4419","resolution":{"observed_at":"2026-08-07T10:54:31.334046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:54:30.426294Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.426294Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:c7b96b0956bc5ca7c3a63a74955b8bb3847e12ee11106c9d69f6ea8b5a5061a8","observation_id":"f8bb9a67-7d7d-4f46-b83f-0bd423b7d5cf","resolution":{"observed_at":"2026-08-07T10:54:30.426294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2407.11511","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.806600Z","title":null,"venue":null,"work_id":"c2b67fd3-1918-4232-b9f7-7ed9bfe52e5f","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.433102Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:79b9b7c537c3927dc009d6d38bdc0cd06e1ca87ce2933495e57af62a80254f3b","observation_id":"6d686e0a-dd7c-4f91-acc8-61c7629fb771","resolution":{"observed_at":"2026-08-07T10:54:30.814271Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.438229Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.438229Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:f7e2109c5879382923cb7d5c0869f9613a4ebca1d805508e7ab34fe5c4f3b5b3","observation_id":"dc63a20b-8944-4eb4-bc6d-1ece1d2221cb","resolution":{"observed_at":"2026-08-07T10:54:30.438229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.311989Z","title":"Hamilton, Chris Dyer, and Dani Yogatama","venue":null,"work_id":"4a624032-a483-42c4-9da7-2b3cc05f0086","year":2021},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.452391Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:a8971c16fda8de726f768af3ce5013205a55b6b97d8cdfb249cc6b8f4ab9e4f6","observation_id":"fcf82ccf-3bca-47ba-9c8a-d3e1b1016088","resolution":{"observed_at":"2026-08-07T10:54:31.317364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:54:30.459827Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.459827Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:4bce1d6187b5c1ab6ab89d8eb580ef87d02285515f6cf93b1b19d4a398f18e12","observation_id":"bae75213-a5d1-42b0-86b0-f506496e4722","resolution":{"observed_at":"2026-08-07T10:54:30.459827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.469858Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.469858Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:55452ee59460018f0ad85706dd53e2a8abe9fb471dbf7a95760249a195876810","observation_id":"c30857ee-2823-4424-89db-3c9bbfc19591","resolution":{"observed_at":"2026-08-07T10:54:30.469858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:54:30.477067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.477067Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:ce07555d7ffd8e73297ae65f176561dc82ca975f67ef957721cbafc4aa94ba5f","observation_id":"d8032718-9c9e-405e-a0c7-87b19773f16c","resolution":{"observed_at":"2026-08-07T10:54:30.477067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.490021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.490021Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:c1f325e7a6160c83cecc792d71258b91f5c7fcaa04007f681bef604eb9696866","observation_id":"18bd1d35-7962-433c-85db-c9a5f62d1ff6","resolution":{"observed_at":"2026-08-07T10:54:30.490021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.496064Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.496064Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:b2179085355fafb5cc65e220f36ead1da9f1253e4f89b80704e38efb9721ce7f","observation_id":"bd59f18c-0d90-4f7e-a453-cdf0ff7fbca9","resolution":{"observed_at":"2026-08-07T10:54:30.496064Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.500940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.500940Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:26343c3f788dc04647d55d27f899f82a3474a5fc8649705b8121d30b6825f43f","observation_id":"af55d101-5b80-4f5e-ac71-85e70df80ed6","resolution":{"observed_at":"2026-08-07T10:54:30.500940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09561","last_updated":"2023-10-19T12:24:42Z","snapshot_observed_at":"2026-08-08T04:22:59.965467Z","submitted_at":"2022-12-19T15:51:52Z","title":"Large Language Models are Better Reasoners with Self-Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09561","snapshot_observed_at":"2026-08-07T10:54:30.506047Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.506047Z"},"links":{"cited_paper":"/paper/2212.09561","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:c235326f26b1304383124c6b6f964332af6ec3c12ecc4036bcfe68f57d682741","observation_id":"c931d564-86c3-4854-8096-736595ec00c7","resolution":{"observed_at":"2026-08-07T10:54:30.506047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.293582Z","title":null,"venue":null,"work_id":"08ec3ea6-084d-4352-89e7-bc5de9ed7d52","year":2012},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.510945Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:26c91c82e119487034383d30a48435e51dadabede1f92090effa4f110fac100d","observation_id":"5a9be03b-020e-41a3-9b34-421110aa12fb","resolution":{"observed_at":"2026-08-07T10:54:31.299174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:54:30.515642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.515642Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:3db6a1bbe00ad4cfbbdba9172ac17b3062930c5e14b90e6aa938a315e2d05eb0","observation_id":"82a47b6f-2838-4763-95c5-5382dddf54a7","resolution":{"observed_at":"2026-08-07T10:54:30.515642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.520686Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.520686Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:55cbedbe7c6e8c85a99d81cf6377140a75c18526ad86b0f3b46fcbaae1141ab0","observation_id":"a9a73950-9e81-4df9-97c0-d657ab55938b","resolution":{"observed_at":"2026-08-07T10:54:30.520686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.276282Z","title":null,"venue":null,"work_id":"4e6a8c76-ae17-4889-8a82-380ced51bb63","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.525537Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:c53fddc40b925cea1392c6cdea38399e07825106ff0a2c05e41bf2e2c275b6dc","observation_id":"274306c3-fb9d-4eaf-9901-3a7d595e016f","resolution":{"observed_at":"2026-08-07T10:54:31.281471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T10:54:30.531319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.531319Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:d7db6405ec3d4737cece836fdd51ab3ef199583b529021df50b52a4388588994","observation_id":"2f4f4220-882a-42d8-b558-e67ea766ce81","resolution":{"observed_at":"2026-08-07T10:54:30.531319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-07T10:54:30.536308Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.536308Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:31c6dc039eb1e759f54908626be78a7cb489f251b527b5d5ae96638305cffcdf","observation_id":"eb7b1617-4827-4063-a3b5-eef1198cf550","resolution":{"observed_at":"2026-08-07T10:54:30.536308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.258457Z","title":null,"venue":null,"work_id":"f89a7d31-cb0d-4d02-ac4d-aa840631ac88","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.541560Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:142ee7928848477c742c42a4cf5ea5e51114e727a3193f62c3cda4e576b0bc3c","observation_id":"49404bab-a40d-4d0f-8bac-a4fa4024a915","resolution":{"observed_at":"2026-08-07T10:54:31.263577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T00:05:34.074752Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 14 inbound Pith citation observations for arXiv:2506.04185."}