{"as_of":"2026-08-08T12:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36f529434bb01014a0d0016211dac6661fc86356fe8bf90b759a6e88c3c2b1e3","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:17:14.224235Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:18:44.717716Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:09:59.246273Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10874","snapshot_observed_at":"2026-08-05T16:18:44.717716Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18763","last_updated":"2025-08-26T07:41:33Z","snapshot_observed_at":"2026-08-08T03:30:31.091934Z","submitted_at":"2025-08-26T07:41:33Z","title":"Dynamic Collaboration of Multi-Language Models based on Minimal Complete Semantic Units","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T16:18:44.717716Z"},"links":{"cited_paper":"/paper/2508.10874","citing_paper":"/paper/2508.18763"},"observation_digest":"sha256:680f531b4026c20617f7b2bec3bed69d686230634ffc5995a853a3728deb8fab","observation_id":"1b4875cd-9bb5-40da-a5e3-985edbd95183","resolution":{"observed_at":"2026-08-05T16:18:44.717716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.10874","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10874","snapshot_observed_at":"2026-07-04T17:09:59.246273Z","title":"Ssrl: Self-search reinforcement learning","venue":null,"work_id":"c683ed23-515e-491e-a19f-6ed448756e15","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":292,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.10874","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c9efb4e959ff61ad7aaf9101aab002b28cead2e896c1cf77feaa324f9726c085","observation_id":"f591b89f-408e-4b86-9ffb-52c78f9a0b70","resolution":{"observed_at":"2026-05-18T19:21:48.095055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.10874","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10874","snapshot_observed_at":"2026-07-04T17:09:59.246273Z","title":"Ssrl: Self-search reinforcement learning","venue":null,"work_id":"c683ed23-515e-491e-a19f-6ed448756e15","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2508.10874","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:fc98f2c718eb96f49e3f9835d0de76c6e7a42814702c32cda341150ded893cd7","observation_id":"997be28b-ee60-4cac-a025-0ed4cfbcf684","resolution":{"observed_at":"2026-05-18T00:02:25.347982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.10874","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10874","snapshot_observed_at":"2026-07-04T17:09:59.246273Z","title":"Ssrl: Self-search reinforcement learning","venue":null,"work_id":"c683ed23-515e-491e-a19f-6ed448756e15","year":2025},"citing_paper":{"arxiv_id":"2510.00861","last_updated":"2026-04-20T08:17:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T13:10:36Z","title":"Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T11:06:20.058342Z"},"links":{"cited_paper":"/paper/2508.10874","citing_paper":"/paper/2510.00861"},"observation_digest":"sha256:93780c950f742adde0be42f84a4125c0848cf69c38a2d735a85a8080fe3ef26e","observation_id":"c7c41de9-4fe9-4c31-8288-f52bc1be63bb","resolution":{"observed_at":"2026-05-18T11:11:18.267234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.10874","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10874","snapshot_observed_at":"2026-07-04T17:09:59.246273Z","title":"Ssrl: Self-search reinforcement learning","venue":null,"work_id":"c683ed23-515e-491e-a19f-6ed448756e15","year":2025},"citing_paper":{"arxiv_id":"2606.24597","last_updated":"2026-06-23T13:53:55Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T13:53:55Z","title":"Qwen-AgentWorld: Language World Models for General Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:31.403419Z"},"links":{"cited_paper":"/paper/2508.10874","citing_paper":"/paper/2606.24597"},"observation_digest":"sha256:9aa08db5d2f3ab84ec850a047a33233804c27d84868d2291885d3f7c901bf08b","observation_id":"9a8e4261-7149-48d1-8b52-f4ca13a5f9c2","resolution":{"observed_at":"2026-07-04T17:09:59.247985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10874/citation-record","integrity":"/paper/2508.10874/integrity","json":"/paper/2508.10874/citation-record.json","paper":"/paper/2508.10874"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T20:17:07.082566Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:07.082566Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:d4d2739a50278e05ddd4b74be4bfff3196ca9d5e2a2b523d110506d9f36d0996","observation_id":"e660644d-2afa-4c06-bfb3-b2ace5a8519e","resolution":{"observed_at":"2026-08-05T20:17:07.082566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:07.140938Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:07.140938Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:dd5f26afb9b66dede24a33eee7282bf25e377cea2d44fe42d998cbecd7bad432","observation_id":"5174f725-50ae-492a-a825-3a6c242c5328","resolution":{"observed_at":"2026-08-05T20:17:07.140938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-07-06T20:58:19.305457Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-05T20:17:07.244058Z","title":"Pan, Wen Zhang, Huajun Chen, Fan Yang, Zenan Zhou, and Weipeng Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:07.244058Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:a8c905f1970f2a31522e2ffa40d7908a0464ce4cc3d2549fc24af8d334ffb791","observation_id":"81b68b3e-8c5a-4e6e-9f3b-686b6d3fa244","resolution":{"observed_at":"2026-08-05T20:17:07.244058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T20:17:07.379560Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:07.379560Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:9282075bbc37d93ee4276a3279ff8ede037cd91fefac87cc40c90a3c38cbac3e","observation_id":"066bb555-cc25-4e86-8aa1-0bcaf8648914","resolution":{"observed_at":"2026-08-05T20:17:07.379560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T20:17:07.516675Z","title":"The entropy mechanism of reinforcement learning for reasoning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:07.516675Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:c2f7f3f93630e0d6d8cf0978ace84aa154a2551d49a723add4fc8b239620b203","observation_id":"704fe00b-b2eb-4fd2-baee-79c97318e82e","resolution":{"observed_at":"2026-08-05T20:17:07.516675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13187","last_updated":"2025-03-08T06:36:16Z","snapshot_observed_at":"2026-08-07T18:08:55.682886Z","submitted_at":"2025-02-18T12:57:29Z","title":"A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13187","snapshot_observed_at":"2026-08-05T20:17:07.610161Z","title":"A survey of sim-to-real methods in rl: Progress, prospects and challenges with foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:07.610161Z"},"links":{"cited_paper":"/paper/2502.13187","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:6da702ca563899973b304dce6286cb13801d23e3cea7f108a6a8aa89f3616bbf","observation_id":"82eed66f-a399-4593-9a7b-cbc81c49c252","resolution":{"observed_at":"2026-08-05T20:17:07.610161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:17:07.780237Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:07.780237Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:577d8cf2cfe613fa5bbc6e23c91294ddc442826acc1d99238008e25f59005b99","observation_id":"25d1b355-7e9d-44b4-b808-93831202c15f","resolution":{"observed_at":"2026-08-05T20:17:07.780237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:16.018125Z","title":"Citations and trust in llm generated responses","venue":null,"work_id":"b963ceb6-8ab4-4363-808b-6f9b41b0eae4","year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:07.896751Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:642efbdaf71df6bf88dc493ebfb6e75c391c85d364b3078c74364fd38d157b1d","observation_id":"9fcc3ac4-0e5b-497c-a10c-6ff4f05bb5ef","resolution":{"observed_at":"2026-08-05T20:17:16.055399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-05T15:21:07.825807Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-05T20:17:08.011061Z","title":"Competitive programming with large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:08.011061Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:f4fef693d5c0652dad700a7eb29e73cc14127cfb1bcb98b5f632e5310d3e5fd3","observation_id":"42c01a12-0b8f-491c-bbc5-b0c84ccbab26","resolution":{"observed_at":"2026-08-05T20:17:08.011061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-05T20:17:08.153794Z","title":"Retool: Reinforcement learning for strategic tool use in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:08.153794Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:58248f110f94196068eb2daa3b38c4c2e467a9ec293b1a95ee87a8a2adc390d7","observation_id":"f631ddf0-5609-442e-b5b5-5a9908f3b02d","resolution":{"observed_at":"2026-08-05T20:17:08.153794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-05T20:17:08.299466Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:08.299466Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:4e739a105b0572c0dbea563cacace312fab8e224bc9760481303deb6f02810af","observation_id":"1635789a-eb37-4632-98e2-5d0c265d6d45","resolution":{"observed_at":"2026-08-05T20:17:08.299466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21046","snapshot_observed_at":"2026-08-05T20:17:08.416770Z","title":"A survey of self-evolving agents: On path to artificial super intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:08.416770Z"},"links":{"cited_paper":"/paper/2507.21046","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:7565a82e0bc38d700772edbe8f0ea345771c56be8211a31b3a0e6a7dc7b7ab48","observation_id":"ac084a07-791c-4efc-9c54-bb54ff541e1b","resolution":{"observed_at":"2026-08-05T20:17:08.416770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14627","last_updated":"2023-10-31T15:04:35Z","snapshot_observed_at":"2026-08-07T16:43:54.797998Z","submitted_at":"2023-05-24T01:53:49Z","title":"Enabling Large Language Models to Generate Text with Citations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14627","snapshot_observed_at":"2026-08-05T20:17:08.576057Z","title":"Enabling large language models to generate text with citations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:08.576057Z"},"links":{"cited_paper":"/paper/2305.14627","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:5ada23643e7ed1aaf9b1ed98df1a322a0505a052882e1606c93e39d05fc05b52","observation_id":"e5bbfe28-e7c3-489a-86d2-017851b123fb","resolution":{"observed_at":"2026-08-05T20:17:08.576057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T20:17:08.686291Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:08.686291Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:bad17e559e7154cb2c005e25e553dec84c1ab9946822caad99d0ba7ee02d9e6e","observation_id":"d62b9b14-86a4-4930-9d3e-b97ab0a2f297","resolution":{"observed_at":"2026-08-05T20:17:08.686291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06559","last_updated":"2025-04-01T05:04:47Z","snapshot_observed_at":"2026-07-06T19:48:10.800324Z","submitted_at":"2024-11-10T18:50:51Z","title":"Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06559","snapshot_observed_at":"2026-08-05T20:17:08.840484Z","title":"Is your llm secretly a world model of the internet? model-based planning for web agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:08.840484Z"},"links":{"cited_paper":"/paper/2411.06559","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:796461ce1ca47a74d5e95b70b744cad38fcb07faa19d87fb139821829fb88557","observation_id":"3aaea7a4-83e8-4d98-933a-e9d41467abcc","resolution":{"observed_at":"2026-08-05T20:17:08.840484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-05T20:17:09.037240Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.037240Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:64754637dc7a9c9c3793fdda913177ae711a14093609206ff4f649f8b37cb403","observation_id":"7f829c9f-5fbd-4ad7-bc12-8da44b93d272","resolution":{"observed_at":"2026-08-05T20:17:09.037240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-05T20:17:09.215321Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.215321Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:fc587d8f8e462b035d341c0975b7691a93c33c31d2a1f04eadeb887ecad4ba80","observation_id":"e79197a4-5345-4fe4-8716-3f031433b673","resolution":{"observed_at":"2026-08-05T20:17:09.215321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-05T20:17:09.323202Z","title":"Reinforce++: An efficient rlhf algorithm with robustness to both prompt and reward models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.323202Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:20150f61405306a7871b21dae468013fa3a4eee704a53f29cf30a182cf613e91","observation_id":"669820f7-1974-43f8-85c3-eb94427b164f","resolution":{"observed_at":"2026-08-05T20:17:09.323202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-07T15:21:20.850969Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-05T20:17:09.393341Z","title":"Arik, and Jiawei Han","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.393341Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:f6bb55cc494c46abe8693d77f27127b06ba90ca0feb79c9e84aff30a21ad5058","observation_id":"3e06a672-a89a-4390-a2df-320dc727fe33","resolution":{"observed_at":"2026-08-05T20:17:09.393341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T20:17:09.409539Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.409539Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:18f5dffc04488fea7d308f0bf92323e833358706c87eb183ab1d6c79b0f10ea3","observation_id":"1a52d4d0-b364-4586-b9d8-587a9ba961d1","resolution":{"observed_at":"2026-08-05T20:17:09.409539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-05T20:17:09.457321Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.457321Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:d03dba1ad4cee4b496c00e6c0e1ad46ba7c5ff6d0142df59ebadd28f0c2ee6c4","observation_id":"3cff19dd-0333-4be6-91eb-5e001564d9a5","resolution":{"observed_at":"2026-08-05T20:17:09.457321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:15.894895Z","title":"Sim2real transfer for reinforcement learning without dynamics randomization","venue":null,"work_id":"5e99be7c-d863-4859-8f66-a72ef0ed5230","year":2020},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.570035Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:2001654fb82ccbe930ba0d7b5a717b69580b6ea10f9b9d17fa74eeeedb269a06","observation_id":"d1c5cf19-f396-4075-800d-3440538a65b6","resolution":{"observed_at":"2026-08-05T20:17:15.944894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:09.639320Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.639320Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:ada76608e42d48903a2931e363cf288b4dd3cd14410054cae81e878769208a59","observation_id":"64d4c93a-bbf1-4918-8e8a-76fe19db7a7a","resolution":{"observed_at":"2026-08-05T20:17:09.639320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T20:17:09.710424Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.710424Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:a3c2614d4b6b1eb2b56f42ad94196a95977e88f3702968745724e39e23443e88","observation_id":"71bf551d-680e-43a1-a83b-17835cde46b4","resolution":{"observed_at":"2026-08-05T20:17:09.710424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14382","last_updated":"2025-02-20T09:18:53Z","snapshot_observed_at":"2026-08-07T18:02:33.909462Z","submitted_at":"2025-02-20T09:18:53Z","title":"S*: Test Time Scaling for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14382","snapshot_observed_at":"2026-08-05T20:17:09.862906Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.862906Z"},"links":{"cited_paper":"/paper/2502.14382","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:4bf1899fa357bad610cc52de07086e68eba15fa9313a52499f3251e0f9193437","observation_id":"cae576c8-daad-4d64-87ee-56724e58b22c","resolution":{"observed_at":"2026-08-05T20:17:09.862906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:15.768643Z","title":"Emergent world representations: Exploring a sequence model trained on a synthetic task","venue":null,"work_id":"445a9ba3-0dff-418e-a832-268ffefbe3e2","year":2023},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.970482Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:dd9c2173960669163ac69ab7acef04f80a0728947e906e5b0b41cc6bcc604c02","observation_id":"c0c76f63-b0dc-4add-bdbb-cefe3781db74","resolution":{"observed_at":"2026-08-05T20:17:15.829090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01176","last_updated":"2024-04-21T08:33:32Z","snapshot_observed_at":"2026-08-06T02:46:21.101821Z","submitted_at":"2024-02-02T06:44:22Z","title":"CorpusLM: Towards a Unified Language Model on Corpus for Knowledge-Intensive Tasks","version":2},"cited_work":{"arxiv_id":"2402.01176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.01176","snapshot_observed_at":"2026-08-05T20:17:14.935394Z","title":"CorpusLM: Towards a Unified Language Model on Corpus for Knowledge-Intensive Tasks","venue":"cs.CL","work_id":"a8eaee9d-412e-4c52-ad76-28c816c2f929","year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.055596Z"},"links":{"cited_paper":"/paper/2402.01176","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:cb060bd2d4b725487d74237718e196698e0f1685e8a09af00dcbaebe7f7e47ad","observation_id":"34037597-400a-4e64-99f6-751bc4f6b000","resolution":{"observed_at":"2026-08-05T20:17:15.004781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-05T20:17:10.120457Z","title":"Search-o1: Agentic search-enhanced large reasoning models, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.120457Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:707cc225f4ec7fa8c984cf6b8e1d986be1c8eb5fd25ea7142270b6beadc3695b","observation_id":"25160b53-2978-4454-8697-0e4ca2084107","resolution":{"observed_at":"2026-08-05T20:17:10.120457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:15.638470Z","title":"From matching to generation: A survey on generative information retrieval","venue":null,"work_id":"699696fc-aad3-4d72-82e7-7129fb84c0c4","year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.230492Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:3f79aa0ff10b9884461154b81c320943ef1d37d9943ea623fd3c6b020120e6ee","observation_id":"fe433099-c955-48a3-be81-58857651866a","resolution":{"observed_at":"2026-08-05T20:17:15.701341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16924","last_updated":"2024-04-25T17:58:17Z","snapshot_observed_at":"2026-07-06T18:05:46.922400Z","submitted_at":"2024-04-25T17:58:17Z","title":"A Survey of Generative Search and Recommendation in the Era of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16924","snapshot_observed_at":"2026-08-05T20:17:10.345154Z","title":"A survey of generative search and recommendation in the era of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.345154Z"},"links":{"cited_paper":"/paper/2404.16924","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:33fdc509c860c7ff579fc2ee49f1231b9feebe22b56c2727b88b1cf0ba0a69cf","observation_id":"b65de2a5-3dfe-497a-805a-14bbe9d2336c","resolution":{"observed_at":"2026-08-05T20:17:10.345154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:15.496365Z","title":"Learning to rank in generative retrieval","venue":null,"work_id":"6af7988d-229b-4051-b673-893e14e36143","year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.430071Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:96979016b1c0413b59928135b11219d8f2cb7ce91e25fe6d6a38c41270f29750","observation_id":"9cbfc218-ed6b-42a1-b648-4e03b3fb8028","resolution":{"observed_at":"2026-08-05T20:17:15.572763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20379","last_updated":"2025-02-27T18:53:30Z","snapshot_observed_at":"2026-08-07T17:41:57.954191Z","submitted_at":"2025-02-27T18:53:30Z","title":"Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20379","snapshot_observed_at":"2026-08-05T20:17:10.502885Z","title":"McIlraith, and Yilun Du","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.502885Z"},"links":{"cited_paper":"/paper/2502.20379","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:44190e60db27cd9f21ed3931631d677c06f4f9c3638a528e78724aa046e6b0e5","observation_id":"2abfb961-6d12-41ba-b824-58ff7ed19bc7","resolution":{"observed_at":"2026-08-05T20:17:10.502885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T20:17:10.603582Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.603582Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:2f2a0a20c8d3e1d6abdf50268450673fa8d62d4ec8732d559d420ded93d015d0","observation_id":"981d5a87-31a4-489d-b30b-7edf2723ae84","resolution":{"observed_at":"2026-08-05T20:17:10.603582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-05T04:32:32.994993Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-05T20:17:10.690804Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.690804Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:43e2e35296f2013f13ed549cdf8698e1a3e39dae1e04419cecf28ff640a52da3","observation_id":"0972242c-07d0-4677-81ae-206435b91c3f","resolution":{"observed_at":"2026-08-05T20:17:10.690804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T20:17:10.754730Z","title":"Understanding r1-zero-like training: A critical perspective, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.754730Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:a938da176a570e4f1f18843b1231faf4ca80484becd479d08955cedb6fd454a2","observation_id":"34cd607f-393e-46b8-b686-fedebd29a29c","resolution":{"observed_at":"2026-08-05T20:17:10.754730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:10.833429Z","title":"Generative multi-modal knowledge retrieval with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.833429Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:04478fb592917f1e7f4c3eee6cd698a472ac1ae8b4a39500b2a4ca612cf7c973","observation_id":"2cc82a03-e7dc-4e1f-9ff4-38693d2f6e13","resolution":{"observed_at":"2026-08-05T20:17:10.833429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T20:17:10.945859Z","title":"Openai o1 system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.945859Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:e74968e0d1e155b583aaed9a10ce64c1f2fa2b87b9c7c0b3d7e2004309d92979","observation_id":"a09b9e17-e2c0-4bc8-926a-6aa6d86d27ef","resolution":{"observed_at":"2026-08-05T20:17:10.945859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21934","last_updated":"2025-09-04T19:36:32Z","snapshot_observed_at":"2026-08-07T16:31:45.129185Z","submitted_at":"2025-03-27T19:21:05Z","title":"Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21934","snapshot_observed_at":"2026-08-05T20:17:11.057856Z","title":"Proof or bluff? evaluating llms on 2025 usa math olympiad","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.057856Z"},"links":{"cited_paper":"/paper/2503.21934","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:4acbc6a636be36925cf7fe3f385d4e6c77ded91292a744e62c0440ddce4139d2","observation_id":"bbf8efaf-4312-4d5e-984a-68622d4d12cc","resolution":{"observed_at":"2026-08-05T20:17:11.057856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-07-31T15:52:06.089691Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-05T20:17:11.138260Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.138260Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:6e26d92fffb0d87c4368d104693a49eeb4656d040667559bef900601005b2e1f","observation_id":"42ffeb56-5f9b-421a-b8a4-120aebb67274","resolution":{"observed_at":"2026-08-05T20:17:11.138260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T20:17:11.220482Z","title":"Toolrl: Reward is all tool learning needs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.220482Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:367ae64d6c26f96357ffdde987ad89fbd891df9a7d09b207ae4aca9054ca2c2d","observation_id":"e82d6f1e-83ba-4f7a-9dd9-24b42ab33272","resolution":{"observed_at":"2026-08-05T20:17:11.220482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06849","last_updated":"2023-05-23T13:15:10Z","snapshot_observed_at":"2026-07-06T15:26:03.107454Z","submitted_at":"2023-05-11T14:47:29Z","title":"WebCPM: Interactive Web Search for Chinese Long-form Question Answering","version":2},"cited_work":{"arxiv_id":"2305.06849","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.06849","snapshot_observed_at":"2026-08-05T20:17:14.659987Z","title":"WebCPM: Interactive Web Search for Chinese Long-form Question Answering","venue":"cs.CL","work_id":"8402c1c6-fadf-4308-a689-1b9c8844cd68","year":2023},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.334274Z"},"links":{"cited_paper":"/paper/2305.06849","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:08a441dc03260ffd0bdb04fcfb845d3fbe83850b21cd0ee343b42bae2542e993","observation_id":"4275843b-7c40-4f5d-91ff-4e5dfaa92949","resolution":{"observed_at":"2026-08-05T20:17:14.717417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16033","last_updated":"2025-09-03T03:41:08Z","snapshot_observed_at":"2026-07-06T19:37:07.379149Z","submitted_at":"2024-10-18T04:38:21Z","title":"TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16033","snapshot_observed_at":"2026-08-05T20:17:11.414943Z","title":"Treebon: Enhancing inference-time alignment with speculative tree-search and best-of-n sampling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.414943Z"},"links":{"cited_paper":"/paper/2410.16033","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:3c507a9cd3b7a0fc14b2130c2178a77af9bf8155f6ee74ddb84695d88fcaf77e","observation_id":"fb3313db-e19b-4ff9-b1ad-dbfe0c1f15ce","resolution":{"observed_at":"2026-08-05T20:17:11.414943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T20:17:11.513187Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.513187Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:3d8e8959136c2980e9dc312540766eeb35cd685933fbf23189647d7cd1271988","observation_id":"166ef671-64e5-4e50-9dab-f72d13048071","resolution":{"observed_at":"2026-08-05T20:17:11.513187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T20:17:11.582880Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.582880Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:1cd2c51f126ad3d6c4c1c84d6a853041a10846c790e38f60255f9d99847f4e71","observation_id":"e27dd7cf-c73d-43e3-9281-374eed56989c","resolution":{"observed_at":"2026-08-05T20:17:11.582880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T20:17:11.674940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.674940Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:879eb2e26d900c6d72af5ca6fdd01dfb1aa06887e0c15b670cf25cefb0ae0617","observation_id":"4a7746c4-18cf-4309-beb6-d3d9beed30a0","resolution":{"observed_at":"2026-08-05T20:17:11.674940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-08-05T20:17:11.770737Z","title":"Thinking vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.770737Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:241df56f6bef031244b305126ae9bc5d84076c9ccfdb39f9b364c6e033dc79e2","observation_id":"78856db5-fe51-411c-96bf-e5a93e222d04","resolution":{"observed_at":"2026-08-05T20:17:11.770737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-03T00:52:54.308486Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-08-05T20:17:11.877617Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.877617Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:99e66e71cffec739835361fbdb552720b681acf444597e4f2938b9caaf51ada8","observation_id":"e9038f3a-fd3a-454f-9deb-93ccf45879b9","resolution":{"observed_at":"2026-08-05T20:17:11.877617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T20:17:11.983940Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:11.983940Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:169f10cdadf5e8dfc16d02d184e03dde851056fc8601ac991c249ea5a90267f0","observation_id":"39bd7740-f962-4252-8546-8abd5810261a","resolution":{"observed_at":"2026-08-05T20:17:11.983940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-05T20:17:12.061269Z","title":"Zerosearch: Incentivize the search capability of llms without searching, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.061269Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:70887e1910aa3f9026294faed5135920cf20ac3c9b22e6f62738a0d545a957e7","observation_id":"b8f7c3d2-1a78-4583-892c-4749ddd15efa","resolution":{"observed_at":"2026-08-05T20:17:12.061269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:15.368229Z","title":"Worldcoder, a model-based llm agent: Building world models by writing code and interacting with the environment","venue":null,"work_id":"7291e9be-2a17-4ad0-bc37-a4a2a7e958c5","year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.144246Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:db16531ce9781240953ef88264b0b566bbd6e170d16210c06ae6e5dff85d32af","observation_id":"97d453e7-df30-4c77-9a58-058311b88095","resolution":{"observed_at":"2026-08-05T20:17:15.423680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:12.247238Z","title":"Transformer memory as a differentiable search index","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.247238Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:e9d8e39675292b907dad0e37ee2bb223da9eef2ba45012388f4bacdb73fa4baf","observation_id":"2221edb6-7c2d-4f56-9f77-b4833d2fdb2b","resolution":{"observed_at":"2026-08-05T20:17:12.247238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T20:17:12.345692Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.345692Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:cbf237ebe913420af656f7735d8b27673e573c0385042a1e4b4e9954dd9cdcd3","observation_id":"19cb28b6-ecbe-45e0-9a22-0be3e0b0946d","resolution":{"observed_at":"2026-08-05T20:17:12.345692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00573","last_updated":"2022-05-05T05:50:50Z","snapshot_observed_at":"2026-08-05T14:23:49.315145Z","submitted_at":"2021-08-02T00:33:27Z","title":"MuSiQue: Multihop Questions via Single-hop Question Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00573","snapshot_observed_at":"2026-08-05T20:17:12.419079Z","title":"Musique: Multihop questions via single-hop question composition, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.419079Z"},"links":{"cited_paper":"/paper/2108.00573","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:405d28faeec71e4814bddff12215ae013db4f97f57e1f60bc32c6085cf8d036c","observation_id":"e34e3623-2212-45eb-996d-5d4a39a593ff","resolution":{"observed_at":"2026-08-05T20:17:12.419079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:12.524672Z","title":"A neural corpus indexer for document retrieval","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.524672Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:d05f080c26ec6e265ad56787956523145dd29c9097350a217e2325b92909f4dd","observation_id":"84542cda-df2e-4f4b-ad73-aa6fa116ac58","resolution":{"observed_at":"2026-08-05T20:17:12.524672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-06T22:44:10.264269Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-05T20:17:12.589663Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.589663Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:f4720aa90bb7397299579945256d9a76976dfc4db467472402b0a1c0000d9300","observation_id":"ef6e6e4c-790c-4b24-8c58-4716de72ec9d","resolution":{"observed_at":"2026-08-05T20:17:12.589663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T20:17:12.728962Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.728962Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:0d6a3e49db3884675bae10937175ed1dedb8dc20013593ed3d00202c08b29114","observation_id":"ac04a7b9-7d04-41c4-be28-29de60856bbc","resolution":{"observed_at":"2026-08-05T20:17:12.728962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-05T20:17:12.825794Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.825794Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:697504342a58c0eda9e9498e6833c48691a16b574ed0b586c995fe56ccf28f6e","observation_id":"7a8f45fd-17ae-43a2-88d7-41a99c1bec28","resolution":{"observed_at":"2026-08-05T20:17:12.825794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T20:17:12.901494Z","title":"Measuring short-form factuality in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.901494Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:62f87b81bb6a9781cddc39b08a21d05a630465028ba7e0e26390c92b4ea9be23","observation_id":"914e4dc4-33d4-4f3d-9017-87ea06285be2","resolution":{"observed_at":"2026-08-05T20:17:12.901494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-05T20:17:13.008368Z","title":"Browsecomp: A simple yet challenging benchmark for browsing agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.008368Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:39bf368d5beb8de678592b4ddcfcd7b605efc8ffc86d7043a3c8501e1df8862e","observation_id":"65abb7e1-0218-4aa4-80d4-013c5f0659fc","resolution":{"observed_at":"2026-08-05T20:17:13.008368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-05T20:17:13.081546Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.081546Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:ecdeee8be5acd072d035f07d815ce7d2b72923f29de6b32d70c1a508b9ae645e","observation_id":"27d9c8ff-0767-4307-923d-b64106e9eaf9","resolution":{"observed_at":"2026-08-05T20:17:13.081546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T20:17:13.289705Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.289705Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:05174349e3be7853b8a67cabfc5e5a9744a8966aac891945e08b278faffb8e20","observation_id":"46d3f3ca-4670-4aad-9895-4aff26ec06c8","resolution":{"observed_at":"2026-08-05T20:17:13.289705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05791","last_updated":"2025-10-03T23:50:19Z","snapshot_observed_at":"2026-07-30T10:31:35.758747Z","submitted_at":"2025-07-08T08:52:18Z","title":"GTA1: GUI Test-time Scaling Agent","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05791","snapshot_observed_at":"2026-08-05T20:17:13.398421Z","title":"Gta1: Gui test-time scaling agent, 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.398421Z"},"links":{"cited_paper":"/paper/2507.05791","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:5170392eeede94f65634dc1e2c8cb05097c35fc410886fb011952a8514794cc7","observation_id":"b6745111-7cb8-4e4f-9809-50c5f97366c1","resolution":{"observed_at":"2026-08-05T20:17:13.398421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T20:17:13.464960Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.464960Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:2c4906860dd87b8975f51447aff684831367c57c3ce6d36edbbdf7eb7acefffd","observation_id":"d32414e7-31d1-4337-9f87-0812da702845","resolution":{"observed_at":"2026-08-05T20:17:13.464960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T20:17:13.572346Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.572346Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:3bfc776e2bf2524dfab706951351b30ca890d0faade462a851b9626fb10f477a","observation_id":"86181fa9-55ff-4a86-b63b-b2e198330cfd","resolution":{"observed_at":"2026-08-05T20:17:13.572346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T20:17:13.673603Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.673603Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:dcdcd75df06b614e70377823e7a98210e85002efe94c724329f04f216d2a21b6","observation_id":"1541f30a-c8b1-4377-9cba-48384864dc1f","resolution":{"observed_at":"2026-08-05T20:17:13.673603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-05T20:17:13.787573Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.787573Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:1ddb07180ce4d550c3d4d2f0b674a00bd6fa20541cc0dbee78d77761a1dad23c","observation_id":"eaee824b-2e7b-430b-a2b6-27158195c2c0","resolution":{"observed_at":"2026-08-05T20:17:13.787573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12928","last_updated":"2025-06-15T17:59:47Z","snapshot_observed_at":"2026-08-07T00:35:06.984805Z","submitted_at":"2025-06-15T17:59:47Z","title":"Scaling Test-time Compute for LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12928","snapshot_observed_at":"2026-08-05T20:17:13.855017Z","title":"Scaling test-time compute for llm agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.855017Z"},"links":{"cited_paper":"/paper/2506.12928","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:314fafe0bf29523bb29dc4cfe1c79bc8faa1344f922777ea0cb0957d732ee72e","observation_id":"c74b1a72-ace6-4ffb-8732-1be03af50989","resolution":{"observed_at":"2026-08-05T20:17:13.855017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-05T20:17:13.935000Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:13.935000Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:490e3acd47549ec696be882940adeb77b8f3f8d4798e63afe126848cb9a5f7e7","observation_id":"e5c57250-75b1-47c9-a70b-708ea24a4f42","resolution":{"observed_at":"2026-08-05T20:17:13.935000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:14.035628Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:14.035628Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:24538ef23232525ae042fc08a399735ee23a25aaf1bc1108ceb8b74daf919149","observation_id":"c01981d2-1ba7-461f-8d22-5c30ae39d937","resolution":{"observed_at":"2026-08-05T20:17:14.035628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:14.094327Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:14.094327Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:318cbbe8bee73b07d3dce41178c858817a2c57c30e44a61992df3bfec4d7c8b2","observation_id":"8133ea35-7fd3-4484-bca2-6b690abcd79c","resolution":{"observed_at":"2026-08-05T20:17:14.094327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:14.138015Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:14.138015Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:38af47bb708c4c6b5a11fc805336ad3349eb500b64c50110e801873834e6ddb5","observation_id":"7510aa87-e88a-49dd-b9bd-7891ea4830a5","resolution":{"observed_at":"2026-08-05T20:17:14.138015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:17:14.224235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:14.224235Z"},"links":{"citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:22b287d927a86033f8cfa97d60da8a64a4d64589fa8d889da827061d62762bfd","observation_id":"69291813-5d61-4668-b016-ea021efba23c","resolution":{"observed_at":"2026-08-05T20:17:14.224235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 5 inbound Pith citation observations for arXiv:2508.10874."}