{"as_of":"2026-08-08T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c37c30c12d16755ad853c89d548121ab4e2c56c621f0102f3c1ab7fa93f5affc","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:51:07.554593Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17447/citation-record","integrity":"/paper/2505.17447/integrity","json":"/paper/2505.17447/citation-record.json","paper":"/paper/2505.17447"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:03.557637Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:03.557637Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:6a7e02fe7de4ad758fd7332f8795afe710c88b02cd25e8b9c913144f841d46d5","observation_id":"ddc99e0e-bc13-4ba4-900f-ba774c20b09d","resolution":{"observed_at":"2026-08-07T14:51:03.557637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:03.621425Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:03.621425Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:5166c148b7bfabdee5ede6458827940305ae61382ec3d716563c47140fc17b46","observation_id":"2a5020b2-2df5-4195-85ed-0140fe5887a4","resolution":{"observed_at":"2026-08-07T14:51:03.621425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:03.675051Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:03.675051Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:ebf7c6a9f547b05111f68cace06fa3b6418efcc31aaacb15c6e4cc8ce5f54b0b","observation_id":"f63710ba-99d6-4b5c-a8e3-0d4acbc3a502","resolution":{"observed_at":"2026-08-07T14:51:03.675051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:03.730545Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:03.730545Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:9e23814ac9a974944c8eaf59b2f40154a3d2482b28b72d0b8109b0dd441640fa","observation_id":"b60f4b91-9aa0-4865-8d19-39494c28af2d","resolution":{"observed_at":"2026-08-07T14:51:03.730545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00610","last_updated":"2024-03-31T08:58:54Z","snapshot_observed_at":"2026-08-07T00:34:30.401578Z","submitted_at":"2024-03-31T08:58:54Z","title":"RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00610","snapshot_observed_at":"2026-08-07T14:51:03.812840Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:03.812840Z"},"links":{"cited_paper":"/paper/2404.00610","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:c4ce2d8e958d3526265642ad92a269169a9c4656b6e10a2f31e46bc5c7d958a1","observation_id":"5c4289df-aa49-4bfd-b4c8-0b1c6b55eba3","resolution":{"observed_at":"2026-08-07T14:51:03.812840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:03.904352Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:03.904352Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:11801fe4b91e5689e04c060ee041660b201de21b1045b99a84421a7c9b6ecdfa","observation_id":"05513c23-67ce-46a0-b5ea-3aac191e6fce","resolution":{"observed_at":"2026-08-07T14:51:03.904352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-07-06T20:58:19.305457Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-07T14:51:03.977658Z","title":"Pan, Wen Zhang, Huajun Chen, Fan Yang, Zenan Zhou, and Weipeng Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:03.977658Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:7c18f5ef47e9d91bdbf475493243e27a18a962d70e39dbad9cc099aae8220482","observation_id":"8616e3d9-ac94-43d1-8a5f-803ff7274e3f","resolution":{"observed_at":"2026-08-07T14:51:03.977658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:04.037602Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.037602Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:85244ca9486d45ccd1dfe0a9f5b45e2efeb9a7ec0932b91fa987e77c773d2a12","observation_id":"ac84ba15-6942-4c3b-9d3f-13e9829e234a","resolution":{"observed_at":"2026-08-07T14:51:04.037602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:08.585593Z","title":null,"venue":null,"work_id":"a73c6b01-77d5-4625-b4d6-9e8426244d3c","year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.132959Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:62a0a5a11a7fad68df0e940605637c70dbb1f99e20bf2544b4066924de53a804","observation_id":"540c1f42-7d17-44a9-86f0-1cca27c350c8","resolution":{"observed_at":"2026-08-07T14:51:08.656097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T14:51:04.229471Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.229471Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:48925c0c2d5790a285ad9878a7c9c320aac8d895bfad34e6ae5e59552aaf849e","observation_id":"bb8354ef-1b54-4839-a3c2-5a641560918a","resolution":{"observed_at":"2026-08-07T14:51:04.229471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:51:04.302905Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.302905Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:45cccbe4e9ec8078764bc8d46a6d9c2b1c36691ec8738f5f059c9315b620a984","observation_id":"900a0dd0-d517-4780-9f8a-374166331685","resolution":{"observed_at":"2026-08-07T14:51:04.302905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:51:04.415747Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.415747Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:2b04d7f583bb034b5cafa0f1f13d4219c5034716234082e9cc04357fed08f016","observation_id":"92ae1244-063b-4228-ad8c-916069617028","resolution":{"observed_at":"2026-08-07T14:51:04.415747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:04.526473Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.526473Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:906970508b1543af77a794bc6a3c5a3d64f1966da07600fa3f6d0c39a0212630","observation_id":"c34138c0-57cd-4293-9dfa-b2fcf80b6046","resolution":{"observed_at":"2026-08-07T14:51:04.526473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:04.674751Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.674751Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:e3904aff2b4f021f84b59f8841f65116c6d182ef50c17575fee3551b0c4655ea","observation_id":"1855f7dc-7d70-4c0a-b183-69295266ad13","resolution":{"observed_at":"2026-08-07T14:51:04.674751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:04.805360Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.805360Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:2e5f7075b8fb569e471ae8adee4fca0f8c4ce5d677035ae4316aac09fa38be64","observation_id":"c8fbd589-da3b-4385-97f8-7161bcd416ec","resolution":{"observed_at":"2026-08-07T14:51:04.805360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:51:04.895464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:04.895464Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:5958ff25fcbcc23106307cd9d0137e6298086c4fdd9c62305e84fba0e94d91e1","observation_id":"40be5fa4-2d6b-459f-993b-2d9175aed31e","resolution":{"observed_at":"2026-08-07T14:51:04.895464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T14:51:05.017006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.017006Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:d7a86afd33b128b0a2bc700b44ea58ea0349a5b52665a48043e0d32349e5a90c","observation_id":"b5bcb7d1-23e8-4f43-9f89-467855450021","resolution":{"observed_at":"2026-08-07T14:51:05.017006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T14:51:05.120661Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.120661Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:6e1f73e9e716d6683665da7faa8443a0987351941214c7b2ae44e4f005db2d4d","observation_id":"35ed828b-0ddc-4fb6-b7ba-584e48762e1e","resolution":{"observed_at":"2026-08-07T14:51:05.120661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:05.197470Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.197470Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:ac5443ea58e856de7bda38bd9d9dc50f4895ea563b3c89454ed90de1fad32256","observation_id":"49c9fbde-d648-4579-a270-5f3f5de0c23b","resolution":{"observed_at":"2026-08-07T14:51:05.197470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:05.292452Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.292452Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:7efbd7d96edc9dbdd92c9b3089941e9d1115d5aa582ed196e337e57244a73789","observation_id":"3d4eebcd-b1c4-4713-8fee-3751abedfb3f","resolution":{"observed_at":"2026-08-07T14:51:05.292452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:05.394777Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.394777Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:6d282ce3e489edc157c6602e1f39e92ea3b4fa48b67897a95863145d99f78560","observation_id":"99749a29-fa3b-4cd9-8fdb-e6668e60a372","resolution":{"observed_at":"2026-08-07T14:51:05.394777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06840","last_updated":"2024-06-06T11:55:36Z","snapshot_observed_at":"2026-07-06T17:42:41.349428Z","submitted_at":"2024-03-11T16:01:05Z","title":"RA-ISF: Learning to Answer and Understand from Retrieval Augmentation via Iterative Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06840","snapshot_observed_at":"2026-08-07T14:51:05.517369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.517369Z"},"links":{"cited_paper":"/paper/2403.06840","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:e0e0c4bcca7f0a4182784fad7945797b35d738a012341c912e21bcfcf1f924f7","observation_id":"319efd8c-ff91-4ca4-bc9d-bc117fb75a7a","resolution":{"observed_at":"2026-08-07T14:51:05.517369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-07T14:51:05.603054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.603054Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:f8ad471dc7ad27906a7b9fe6d97903799c85e561aeba978a8810ccb35de1aa99","observation_id":"a82f470d-011e-4a3b-89e3-a38dc9318fd6","resolution":{"observed_at":"2026-08-07T14:51:05.603054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-08-07T18:08:48.524378Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-07T14:51:05.696234Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.696234Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:b48cda81ad83982707de81848bc0e5d16a3fab4a2e3ae1fb9b79915b913fef87","observation_id":"3c54ff20-26cc-4bae-93be-5128e3dd5c00","resolution":{"observed_at":"2026-08-07T14:51:05.696234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:05.831381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.831381Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:9dca5c76dfd8fe53fb024b177366068093aef1cf1290760c48c9a024318d053e","observation_id":"9075dbc7-dca6-4ce0-a0d4-8b7fa5dc78d8","resolution":{"observed_at":"2026-08-07T14:51:05.831381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:05.959734Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:05.959734Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:9f9dcaa179c138a01bd76d6570bd4b93dc2b26da31c580b72041178ed5259c69","observation_id":"d4b9e156-55b7-4c03-ade1-02da44096a7c","resolution":{"observed_at":"2026-08-07T14:51:05.959734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:06.075778Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.075778Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:16db17062f21d6c3c4c9603812cdd4b89ee0b746da2af9877f13866f3f312d2a","observation_id":"a29c04bd-6c1d-42f9-a21a-d4d0980ac8e5","resolution":{"observed_at":"2026-08-07T14:51:06.075778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15294","last_updated":"2023-10-23T09:58:13Z","snapshot_observed_at":"2026-08-03T16:18:57.922065Z","submitted_at":"2023-05-24T16:17:36Z","title":"Enhancing Retrieval-Augmented Large Language Models with Iterative Retrieval-Generation Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15294","snapshot_observed_at":"2026-08-07T14:51:06.155759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.155759Z"},"links":{"cited_paper":"/paper/2305.15294","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:1cfc5e8ecb6ef134aa7f7e58dfa673049ee7a5a56752e0b1177d030fc419b8ee","observation_id":"5723cd8b-a28d-4dac-905e-c07f1810dd56","resolution":{"observed_at":"2026-08-07T14:51:06.155759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:51:06.236881Z","title":"Li, and Daya Guo Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.236881Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:a860aea50e6352d0fcc7cfa5a8282bc842698c76798c5688c09759f2b33aa745","observation_id":"8b1495bc-c7dd-4652-a8ac-7ac9a8c70df7","resolution":{"observed_at":"2026-08-07T14:51:06.236881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07567","last_updated":"2021-04-15T16:24:43Z","snapshot_observed_at":"2026-08-08T00:34:53.168974Z","submitted_at":"2021-04-15T16:24:43Z","title":"Retrieval Augmentation Reduces Hallucination in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07567","snapshot_observed_at":"2026-08-07T14:51:06.345653Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.345653Z"},"links":{"cited_paper":"/paper/2104.07567","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:64f6ad176191f37208bd9238ea6e4c566291e782f01d26db6aa1f0e0c980064a","observation_id":"52e00139-9598-411e-8331-62e17e974472","resolution":{"observed_at":"2026-08-07T14:51:06.345653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:06.435328Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.435328Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:82977074ff75b55ed5d097c40498977a081ba1fe0c7e94b3cca0380ab4b610eb","observation_id":"1665647a-2844-413b-a7f2-10e694823c9d","resolution":{"observed_at":"2026-08-07T14:51:06.435328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:06.582517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.582517Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:c4fe4af75d90834ad052053e9856a9343d8d6ae85e441b7f578b72b5ff995b47","observation_id":"cc1e4a98-1fd4-4fe4-a39c-40d0387cb343","resolution":{"observed_at":"2026-08-07T14:51:06.582517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10509","last_updated":"2023-06-23T00:59:13Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:26:34Z","title":"Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10509","snapshot_observed_at":"2026-08-07T14:51:06.698778Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.698778Z"},"links":{"cited_paper":"/paper/2212.10509","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:395cd9c0ede9b7240257147c035891e330cd20032853794a18467e098083dad6","observation_id":"db6e6dde-4a6b-476f-82e5-ce37d48792bc","resolution":{"observed_at":"2026-08-07T14:51:06.698778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:06.810633Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.810633Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:90e93461020bdaed725657aa141a7feb48ad4a3e7f9a8bc2334c3c59862f9f2e","observation_id":"f94e2822-8781-4923-b20e-d97ab1329a90","resolution":{"observed_at":"2026-08-07T14:51:06.810633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:06.930624Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:06.930624Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:d037f432bf720dea81f30910f7f62b677f2403515735169e1213658b934f3814","observation_id":"0bfcb240-7aae-4869-869a-c7dcc966aa3c","resolution":{"observed_at":"2026-08-07T14:51:06.930624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:51:07.021431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:07.021431Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:108277f15ebead4f6ffe844d8337a3f4cd1dccc111780bda80f452dbe6ea0222","observation_id":"2bb37733-bf38-4ee2-8a90-25746e5b2b85","resolution":{"observed_at":"2026-08-07T14:51:07.021431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:07.125296Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:07.125296Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:3ee893eb3123daad0d8acaaeaa539b1a77271a467914ca7774166c210d44735d","observation_id":"cba88396-bf16-413e-9c65-1101c3478569","resolution":{"observed_at":"2026-08-07T14:51:07.125296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T14:51:07.233790Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:07.233790Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:6e8d014124911418d56d056211aad2c2bf9ee0625d17319506c226eef36c4f4f","observation_id":"243c624a-b41a-4599-9eb5-b087c50bb841","resolution":{"observed_at":"2026-08-07T14:51:07.233790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:51:07.386132Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:07.386132Z"},"links":{"citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:3c05b0551b0ecc1e3d4e20cf0292565303e3faef7458716829beccc66f6c6e23","observation_id":"ca05bcd1-45da-4748-8601-9d36289bd9e2","resolution":{"observed_at":"2026-08-07T14:51:07.386132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19213","last_updated":"2025-03-24T23:39:44Z","snapshot_observed_at":"2026-08-07T16:39:46.715482Z","submitted_at":"2025-03-24T23:39:44Z","title":"A Survey of Large Language Model Agents for Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19213","snapshot_observed_at":"2026-08-07T14:51:07.477804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:07.477804Z"},"links":{"cited_paper":"/paper/2503.19213","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:e42c8ef2b1d3c33c80688ff3ac62e28ad97b32c9c35454649a2b6131888454b6","observation_id":"2221b3fc-dfa4-4292-87c1-568ea50a5ab6","resolution":{"observed_at":"2026-08-07T14:51:07.477804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T14:51:07.554593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:07.554593Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2505.17447"},"observation_digest":"sha256:5af8aefb6a2f62a33537d8c31759cf6b9bc496bab7abaec0a66b4b6890fe2387","observation_id":"85a0d163-ea54-49fd-86bc-68e26e5a3256","resolution":{"observed_at":"2026-08-07T14:51:07.554593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17447","last_updated":"2025-05-23T04:04:05Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:44:44.035377Z","submitted_at":"2025-05-23T04:04:05Z","title":"LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2505.17447."}