{"as_of":"2026-08-07T15:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:778335d7dba374461876aa1376dcd30c79825df3f415777278b42d73d4ee4e13","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T07:58:55.548382Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:19:19.938507Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:19:21.664220Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29697","snapshot_observed_at":"2026-08-04T15:12:55.587685Z","title":"2026 , archivePrefix =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-06T23:36:53.142190Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.587685Z"},"links":{"cited_paper":"/paper/2605.29697","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:1d88f777e15f09b0a5316a1288a06b5e2f9ae7b7f5cbb3971659b21abc3d7a93","observation_id":"5ca19be1-64de-4342-8ce8-60c8f729ab0d","resolution":{"observed_at":"2026-08-04T15:12:55.587685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"cited_work":{"arxiv_id":"2605.29697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.29697","snapshot_observed_at":"2026-08-06T05:19:21.664220Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","venue":"cs.AI","work_id":"fb419b6f-8164-4c5c-acca-4d6dac6559c7","year":2026},"citing_paper":{"arxiv_id":"2608.05102","last_updated":"2026-08-05T17:41:31Z","snapshot_observed_at":"2026-08-07T15:14:22.037464Z","submitted_at":"2026-08-05T17:41:31Z","title":"ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:19:19.938507Z"},"links":{"cited_paper":"/paper/2605.29697","citing_paper":"/paper/2608.05102"},"observation_digest":"sha256:1e94747419bc98641fe8616d3565ea71cd02bbc83040d322118e066453e14d52","observation_id":"85ceb175-2074-47f2-9e7c-9c87469400cb","resolution":{"observed_at":"2026-08-06T05:19:21.725226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.29697/citation-record","integrity":"/paper/2605.29697/integrity","json":"/paper/2605.29697/citation-record.json","paper":"/paper/2605.29697"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13651","last_updated":"2025-06-16T16:16:14Z","snapshot_observed_at":"2026-08-07T00:25:54.557015Z","submitted_at":"2025-06-16T16:16:14Z","title":"xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations","version":1},"cited_work":{"arxiv_id":"2506.13651","doi":"10.48550/arxiv.2506.13651","metadata_source":"pith","pith_arxiv_id":"2506.13651","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"xbench: Tracking agents productivity scaling with profession-aligned real-world evaluations","venue":"cs.LG","work_id":"b7f0bdf6-3821-4735-b55e-be58f6ef326d","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2506.13651","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:6d0da2f4baf175fd29e7ff360eaae8986dab40dcfdaf1d15d01a5d92c7fa1071","observation_id":"7b817a55-7a00-43c4-987f-c72140818004","resolution":{"observed_at":"2026-06-29T08:03:14.308144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12800","last_updated":"2025-08-29T10:05:13Z","snapshot_observed_at":"2026-08-07T12:27:09.576328Z","submitted_at":"2025-08-18T10:23:10Z","title":"Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward","version":3},"cited_work":{"arxiv_id":"2508.12800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12800","snapshot_observed_at":"2026-06-29T08:03:14.258925Z","title":"Atom-searcher: Enhancing agentic deep research via fine-grained atomic thought reward","venue":null,"work_id":"eae30bcb-9742-47b9-b4e9-77ad1294d04a","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2508.12800","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:033d7f0a429faa254d7baa6ca77b37b6e68c486941a090336c7ec13ca8d817da","observation_id":"dc32f3e3-071d-4696-a079-8e242b35ae44","resolution":{"observed_at":"2026-06-29T08:03:14.260619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14545","doi":"10.48550/arxiv.2510.14545","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic entropy-balanced policy optimization","venue":"arXiv (Cornell University)","work_id":"da44e859-fbd4-479a-9523-0b6f798ebc23","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:464867b80371decbc7adb03184a395bc8944383138436b9a76ce1cd9f6b98ce5","observation_id":"d4166a03-44b5-4587-8f17-255f64d4260f","resolution":{"observed_at":"2026-06-29T08:03:14.263798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.19849","doi":"10.48550/arxiv.2507.19849","metadata_source":"pith","pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Reinforced Policy Optimization","venue":"cs.LG","work_id":"6cb0d241-5e4d-44ed-9476-659819ec0681","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:a7b008e9a774cd3ca1e13ec840bf61d709ff68408b7c67f57c144c8fee8c6f84","observation_id":"80b367dc-3b22-480d-88ab-3bad878c848f","resolution":{"observed_at":"2026-06-29T08:03:14.276093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00414","last_updated":"2026-04-22T08:14:17Z","snapshot_observed_at":"2026-08-02T16:42:25.825514Z","submitted_at":"2025-08-01T08:11:31Z","title":"Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training","version":3},"cited_work":{"arxiv_id":"2508.00414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00414","snapshot_observed_at":"2026-07-10T17:27:26.693631Z","title":"Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training","venue":"cs.AI","work_id":"37a98a38-d257-4ac7-a1c5-0a5b207f5e2b","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2508.00414","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:7feb93136f0ec820f33c29dc0f41ab02929fdb8ebe23fb97e91dc886ba08b06a","observation_id":"a1ece557-5e33-492e-bd90-82107d9b4733","resolution":{"observed_at":"2026-06-29T08:03:14.283420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07976","doi":"10.48550/arxiv.2508.07976","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond ten turns: Unlocking long-horizon agentic search with large-scale asynchronous rl","venue":"ArXiv.org","work_id":"cf9b5d87-269e-421e-aec4-52f7899c89f0","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:99baedc3b941a410581f028c894cfea29f8e87d0fd5d1a0fa298cd9d50c818cf","observation_id":"42ec8530-48b9-439f-bbf3-73416b70dfc0","resolution":{"observed_at":"2026-06-29T08:03:14.270067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.17365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T17:24:56.779160Z","title":"Dynasearcher: Dynamic knowl- edge graph augmented search agent via multi-reward reinforcement learning.arXiv preprint arXiv:2507.17365","venue":null,"work_id":"a348193e-095c-448e-bad7-4b3e75d5034f","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:40951b7d023c55496cd27bc392b62bf609d89b1aa84546f169d3a6d0cd489548","observation_id":"fdf6f91f-04bc-4300-aa13-a456713746d3","resolution":{"observed_at":"2026-06-29T08:03:14.254457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"cited_work":{"arxiv_id":"2506.11902","doi":"10.5281/zenodo.20953922","metadata_source":"pith","pith_arxiv_id":"2506.11902","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ji, Y ., Ma, Z., Wang, Y ., Chen, G., Chu, X., and Wu, L","venue":"cs.LG","work_id":"8a5d7b13-422d-4d0e-a9e5-2b754a2dc2a9","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2506.11902","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:83931d7b9deed3751ed4e5deb12cffd08649db58ec07c75210b3737259ddbd5f","observation_id":"d66b4fc2-8352-4580-91ae-06aaccc2e7c2","resolution":{"observed_at":"2026-06-29T08:03:14.272895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:04.93196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:56.743354Z","title":"Tree search for llm agent reinforcement learning","venue":null,"work_id":"69c0b47c-2fb7-417a-8ff3-444cc4a56703","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:98c7eef331fd8cdf5669bada2b4a0e418b2520f2b1639afdb1699dd7f0dafe5d","observation_id":"f5f31f6a-ce65-45c5-801a-975b2c08a6ff","resolution":{"observed_at":"2026-06-29T08:03:14.286116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:42d37c0718aaf7740ef1a25717066b9df22e5e30c94497c48805fbc1aa74e201","observation_id":"879b6e96-9067-4bcd-8650-668666258e28","resolution":{"observed_at":"2026-06-29T08:03:14.318817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13305","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:36:04.527882Z","title":"WebSailor-V2: Bridgingthechasmtoproprietaryagentsviasyntheticdataandscalable reinforcementlearning.arXivpreprint","venue":null,"work_id":"6e68b055-1994-4898-8b9f-fccdd4fae80b","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:e4a226a75e84691884ec498346f0d50674c260e846ca7ac0a00ba8695be618f9","observation_id":"9a0f0a16-8580-4da1-83d4-d88bcb579490","resolution":{"observed_at":"2026-06-29T08:03:14.239225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-06T06:12:37.171726Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":"2507.02592","doi":"10.48550/arxiv.2507.02592","metadata_source":"pith","pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","venue":"cs.CL","work_id":"fec5a195-1dd5-425a-b552-109af948a7dd","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:04b95b02f3137220418a0c204fc21e074018ba73880027f66034b7119f338597","observation_id":"d9978c48-f546-4c7e-9286-f988a7dccc87","resolution":{"observed_at":"2026-06-29T08:03:14.255321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2501.05366","doi":"10.48550/arxiv.2501.05366","metadata_source":"pith","pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","venue":"cs.AI","work_id":"6246e99b-7b4e-4424-be78-3e1983932cdc","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:e5381f4011264ce210e3dc2a3753ec33a47a6fca0d04ee93a8f14342f7beab63","observation_id":"7a96e49d-6bf3-4359-9f33-65a07be13d5a","resolution":{"observed_at":"2026-06-29T08:03:14.291784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.06501","doi":"10.48550/arxiv.2509.06501","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Webexplorer: Exploreandevolvefortraininglong-horizonwebagents.arXivpreprint","venue":"arXiv (Cornell University)","work_id":"f67ea6b5-9dbd-417e-bb53-06912e186c85","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:6a6ad21d4ca13571806b831462a52049ba0f1d13942493cd365ae033da5470f8","observation_id":"4c322c72-3308-43a1-a22c-9c6ae5ee641b","resolution":{"observed_at":"2026-06-29T08:03:14.267520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.153429Z","title":"Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers","venue":null,"work_id":"4df9a4a1-3908-4d16-9c0b-253bb245a0c4","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:1700dd7a6c788808255f0c9d7a9e4bbcee1c273ddae53f32438edf783702d1b7","observation_id":"76415858-d599-4028-84d9-55888fcc69dd","resolution":{"observed_at":"2026-06-29T08:03:14.275661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:0607b1e5360aa2b3119a72fbbb5f1c9eb3d0d9107707eec74c291e266ea8d188","observation_id":"f56e9f0f-98d6-4990-82ab-71bf0281071d","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:395875e0a73376df3c71c29b6aad93ca59a8499117fc69f790ad18da43d13256","observation_id":"151a1e16-529e-46a2-9ef3-13c5a411277d","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:e8ce2af46252284c68d44ab37dd0b239066b64964235b8552a33027b95579965","observation_id":"a8593af6-2164-4dc2-b455-8a6ce0bd781c","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:6eb2280170db14a3c86386a4c8b75e53e51379253dbf0030a2ec97a1f31c141c","observation_id":"ae93f585-3973-4684-9b9f-d9ced1423fd6","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:c6c96ef3928ff2964d036815fb1b690039f0051a76e753274345593d3d96f217","observation_id":"0f41ac71-f1e7-40a1-98d1-ee709d3e9eee","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:7eb01cda4e1fa9bbe4ccd86fa0965da91d45aba5881e8c36330c91c981256279","observation_id":"2cbd5282-9b6c-416b-82c8-d4c3dbf02bc8","resolution":{"observed_at":"2026-06-29T08:03:14.263792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:d77049fdc556fe3cf0c4e4cf200c75f4db6cf9783ca367b0b9a2f7dc00ba2788","observation_id":"18c2caa5-c661-43de-8d3a-47db8d1a0964","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.05592","doi":"10.48550/arxiv.2503.05592","metadata_source":"pith","pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","venue":"cs.AI","work_id":"f5ed73d2-f2ff-4cf6-853d-3586333e44ef","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:7306a0b26f4b4ba26a37a1b65a23bc720d428bf1ac53393e8aa5cc313ef87603","observation_id":"bbb2ac45-8346-429e-b00d-935f134bb0ea","resolution":{"observed_at":"2026-06-29T08:03:14.278322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24697","doi":"10.48550/arxiv.2510.24697","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Webleaper: Empowering efficiency and efficacy in webagent via enabling info-rich seeking","venue":"arXiv (Cornell University)","work_id":"1e5dee01-7c7c-48e4-b26a-77eb5bc1ddce","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:9642efa9de915cecd8a9c7da5bc00a3d75db72b0571fcb701b0163c17c18c088","observation_id":"16a2bd18-21b9-4845-a22c-54197f94a5b6","resolution":{"observed_at":"2026-06-29T08:03:14.257602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:35d8a391e7cc645fc3c29ebef6be7ccd26fb3398579ef60dcc9e28aacf12d3be","observation_id":"b321a08b-9c8f-4288-823b-9d76ec4f1bcb","resolution":{"observed_at":"2026-06-29T08:03:14.299693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.11793","last_updated":"2026-04-21T16:02:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-14T18:52:07Z","title":"MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling","version":3},"cited_work":{"arxiv_id":"2511.11793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.11793","snapshot_observed_at":"2026-07-05T15:11:10.874321Z","title":"MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling","venue":"cs.CL","work_id":"126c8814-bfbf-4751-a974-38edb57ff504","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2511.11793","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:ee0df7148d7ba3d769c2f28222fdf9c9446954805a7badbdccdd1d70d56a1b53","observation_id":"33b6ab0a-0fa6-44c0-8078-9432b1919293","resolution":{"observed_at":"2026-06-29T08:03:14.233391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24701","last_updated":"2026-05-18T04:10:32Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:53:02Z","title":"Tongyi DeepResearch Technical Report","version":3},"cited_work":{"arxiv_id":"2510.24701","doi":"10.48550/arxiv.2510.24701","metadata_source":"pith","pith_arxiv_id":"2510.24701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tongyi DeepResearch Technical Report","venue":"cs.CL","work_id":"1c8db01b-b50f-4711-b181-a04bcc3e9aa8","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2510.24701","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:aaf9a53ad00cd8df9f054e1a0fcf6f7a2223eac44ce61b94e82fbaccfbb8b363","observation_id":"0b47dbcc-de77-4b33-94bd-f8a6804ec892","resolution":{"observed_at":"2026-06-29T08:03:14.250181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14438","last_updated":"2026-04-29T01:14:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T08:37:42Z","title":"WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models","version":2},"cited_work":{"arxiv_id":"2510.14438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14438","snapshot_observed_at":"2026-07-03T10:27:56.469481Z","title":"WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models","venue":"cs.CL","work_id":"7a3011ea-9e47-48fc-b18e-11bb9acf0f96","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2510.14438","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:7e755232cbd412458996c4da3eec7860961e79b11386a9c64548648c23a7bb91","observation_id":"1bbb14fa-0f20-4455-ba0c-3ba2a2688f58","resolution":{"observed_at":"2026-06-29T08:03:14.302996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":"2504.12516","doi":"10.48550/arxiv.2504.12516","metadata_source":"pith","pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","venue":"cs.CL","work_id":"25adb508-d97c-49d6-ae43-7a70c2478a34","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:c6528811af9d8329cd0746c0bc0b82e98f547369c54248abfad67d47bfb4d181","observation_id":"e920c3d0-f433-49c0-b0a4-43eefbca219a","resolution":{"observed_at":"2026-06-29T08:03:14.287902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:389ebde38aafef49ce77be6cb939e9b086e80c6552db8cb94d5c3eed50ad7636","observation_id":"f128c70e-03f9-4f48-b480-86714e441ecb","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:07.694390Z","title":"Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment","venue":null,"work_id":"92210c7f-f522-47f8-9b96-564503f5dbca","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:a235661df3f417b111713e74fedc8661f646f96ebf68f030dcde7ed72e194549","observation_id":"cc0b7253-a762-4415-be16-5809958259ca","resolution":{"observed_at":"2026-06-29T08:03:14.239956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-07T13:00:07.473210Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"cited_work":{"arxiv_id":"2505.22648","doi":"10.48550/arxiv.2505.22648","metadata_source":"pith","pith_arxiv_id":"2505.22648","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Webdancer: Towards autonomousinformationseekingagency.arXivpreprint","venue":"cs.CL","work_id":"ca106a7e-910e-4725-b167-348c28d18f1c","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2505.22648","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:c49e018ce4569582686859b20bfafa232d786465bc52617ac15cf28f5396ea42","observation_id":"bc87a14a-d656-4f65-9f93-c601cb9a3d82","resolution":{"observed_at":"2026-06-29T08:03:14.247506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:e96e9d47a694909da8c94cac9d69f3fe62761ac7fc0409443987930968a56803","observation_id":"ded4a9ee-fb55-4456-ae80-430575425e3f","resolution":{"observed_at":"2026-06-29T08:03:14.305567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.05183","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:59:21.123280Z","title":"Treerpo: Tree relative policy optimization","venue":null,"work_id":"77a18a55-496d-41d7-a504-ec3009aa183f","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:12c5d9e39c139f2555980a6739858a0532a75105d0f742a93899583895fe21fc","observation_id":"8f92fc6d-fa29-45b4-a62d-647ef2e1fe93","resolution":{"observed_at":"2026-06-29T08:03:14.316363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:dfe2ce945573fd29d573495f5a80fedb511c2dc7dc16169eb2836767214d565c","observation_id":"1e4102e9-d317-478e-9fd3-b3d9e33a8742","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-07-06T20:30:31.588538Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":"2502.01715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-06-30T12:44:40.230064Z","title":"arXiv preprint arXiv:2502.01715 , year=","venue":null,"work_id":"cb4abcb3-63bf-4564-9b7f-887a01f9163e","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:9ca42e5702ce51eb051b749b3c5a42c09a36cd9440dd242da34cc23bad921a38","observation_id":"1d03fe18-37d5-47bd-8db7-482b1e88f803","resolution":{"observed_at":"2026-06-29T08:03:14.288936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:13356bd7aae1099a59141378f224b7c1d50e1cf58aabc9d3519235661439ce61","observation_id":"0d40df21-ee9d-4796-b9bd-c1e2f5d7d8fa","resolution":{"observed_at":"2026-06-29T08:03:14.280667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:97e8907a8e373f2a13efadca28ab24f3e56d59ea2f26d75f4727e6d7d428d365","observation_id":"6fccf41f-ad9f-4079-8f76-8d91bc0ebaee","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:1023dcfefa4f60e84a63b654a3c9702bbe0a735ad23a0e9f5046d92ce90415be","observation_id":"21de9f86-7d70-4bd5-a42e-b000aa59ea22","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.06021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:39:31.175791Z","title":"Chaining the evidence: Robust reinforcement learning for deep search agents with citation-aware rubric rewards","venue":null,"work_id":"96709fe2-18eb-40b5-85aa-701ea86e19e4","year":2026},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:b5ce5e433c2ff38e0e1aa149338edbe49700215cc407e80137481475f0aacaa6","observation_id":"e3e1dae7-6099-4437-8040-68a3af042211","resolution":{"observed_at":"2026-06-29T08:03:14.297033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:03:14.265069Z","title":null,"venue":null,"work_id":"424cec02-63c8-4483-93c2-43bd2fbcd498","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:d1f7dc360ae982caf8d57a7bc6cc220e4932dfdb2a16c9fd628a69b12414e50c","observation_id":"653e8ddd-a8cf-45f8-8a45-109615f69b6f","resolution":{"observed_at":"2026-06-29T08:03:14.266459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:3442008870654cb11dd88960dae1ca4df5cde47a0203aef9f68238b0c392dc57","observation_id":"f7d6d69f-96bd-4c89-8d14-c5cd76566bce","resolution":{"observed_at":"2026-06-29T08:03:14.294048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:5db70de916ef6fa0ccaa212aae6fcb348dfa6b91bbcc9eea256437b21f73637c","observation_id":"e60b15ae-b6c3-42b6-9654-755a87b60b16","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":"2504.03160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-07-03T04:37:37.738752Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","venue":"cs.AI","work_id":"460d8021-a193-45c3-89a7-b72f6767c87f","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:9d08a722828885a80e3f3c3798e011551437f241344442dae83e22092bfe9b4d","observation_id":"bcd3b997-807a-454c-9b71-30c5c2f650fc","resolution":{"observed_at":"2026-06-29T08:03:14.290658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19314","last_updated":"2025-05-01T05:02:57Z","snapshot_observed_at":"2026-08-06T05:37:40.638404Z","submitted_at":"2025-04-27T17:32:43Z","title":"BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese","version":2},"cited_work":{"arxiv_id":"2504.19314","doi":"10.48550/arxiv.2504.19314","metadata_source":"pith","pith_arxiv_id":"2504.19314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese","venue":"cs.CL","work_id":"d2997896-a54e-43f5-80ac-d4d548116d21","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2504.19314","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:a390296ae00376cc34d5c8de023b429627e97ae31568919217e22e8ad26284a1","observation_id":"96300555-28ba-4565-b59c-c24e00eda21e","resolution":{"observed_at":"2026-06-29T08:03:14.311800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:e1d3e1a6484fbbd57a574903a0fceaf8299ab0b0e010242c0650df5e6ecc7d78","observation_id":"f08e5b1f-3fc2-4fa2-bcab-a6fa3b497cbf","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:58:55.548382Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:91e2f89c10a97cbed2a49a1faa02940002e8cabf6bf702c3a12b03e86db738f4","observation_id":"1fb06325-5626-4a26-a44a-bdcc9db532d5","resolution":{"observed_at":"2026-06-29T07:58:55.548382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":34,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2605.29697."}