Pith. sign in

Paper Citation Record · LEDGER

Deep Research as Rubric for Reinforcement Learning

As of 22 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2606.01091.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.01091 v1

Coverage vector

measured 42 of 42 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-28T17:16:16.243967Z

measured 43 of 43 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T15:12:55.560232Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

42 of 42 outbound references displayed

  • verified exact23
  • verified fuzzy0
  • unresolved14
  • parse uncertain1
  • malformed identifier1
  • metadata mismatch3

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b27f6f4b-0a86-4554-8f44-e5054f702b34 · outbound

This paper cites Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains.

Deep Research as Rubric for Reinforcement Learning Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.266810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:b39d340502347acf0cbfd9b5f6b8a8556059cc9c180c161fb49d84922f4cc209

Observation 2b1eccd0-265f-4be2-9dc1-07a55dba0580 · outbound

This paper cites Does this image satisfy this rule?.

Deep Research as Rubric for Reinforcement Learning Does this image satisfy this rule?

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T17:22:25.272102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:3fae3033e1ae9677fb6f94a4bc3874445cc19955f01ea511b6c1afb91eddf0c8

Observation b05954bf-1324-41ad-89f0-0fc2b5e37e35 · outbound

This paper cites Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning.

Deep Research as Rubric for Reinforcement Learning Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-08-04T02:23:17.018487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:03c04630457102aaa1fc54e5373a7396d206e85a081eb12b21613e775c8f4c6d

Observation 746a89f2-8575-410a-b460-9f61e95aca4d · outbound

This paper cites HealthBench: Evaluating Large Language Models Towards Improved Human Health.

Deep Research as Rubric for Reinforcement Learning HealthBench: Evaluating Large Language Models Towards Improved Human Health

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.230850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:49c2a304c9b6ae2978da986d231cf3d4cc4d3734e122b1a7ef89ea96acd20453

Observation 62da4def-c4b9-4d5f-b6eb-a2f5511e4da1 · outbound

This paper cites arXiv preprint arXiv:2510.07743 , year=.

Deep Research as Rubric for Reinforcement Learning arXiv preprint arXiv:2510.07743 , year=

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T17:22:25.249178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:c2fc293e0f8e695b4803d4cc63ecda42a67745884728c6ce471132f529c44fb4

Observation 5907b663-2a4f-4d98-acb8-805fa0ad37cc · outbound

This paper cites Auto-rubric: Learning from implicit weights to explicit rubrics for reward modeling.

Deep Research as Rubric for Reinforcement Learning Auto-rubric: Learning from implicit weights to explicit rubrics for reward modeling

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-06-28T17:22:25.253380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:582e1feedbff1f6247d3bea284dd4d50c1d56b27efc2ab83803d52930d9d21a4

Observation 3941bab8-d0b9-40f1-bfed-1402aadd0e4f · outbound

This paper cites Reinforcement Learning with Rubric Anchors.

Deep Research as Rubric for Reinforcement Learning Reinforcement Learning with Rubric Anchors

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-28T17:22:25.224950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:4cf84752b5e85b38fe8016592d1d079acf3d83dff5286d0c7ae1ce96de94bc1f

Observation bc13d997-a825-491b-865f-883841171186 · outbound

This paper cites Ace-rl: Adaptive constraint-enhanced reward for long-form gen- eration reinforcement learning.arXiv:2509.04903.

Deep Research as Rubric for Reinforcement Learning Ace-rl: Adaptive constraint-enhanced reward for long-form gen- eration reinforcement learning.arXiv:2509.04903

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-06-28T17:22:25.228460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:cb3b96e4484ba46c3385b5e7c7465d0c9b6b9c1bd684dce2d825f16898d69f52

Observation 64f4f153-758b-4776-99f7-0dcf40ba721e · outbound

This paper cites DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research.

Deep Research as Rubric for Reinforcement Learning DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.222137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:a70c13fe646bfb9900b9b470cf18f2414d347ffd32f847843d47dee47f6ccd4a

Observation 232c5f56-bb53-4007-83d2-b362eaf15298 · outbound

This paper cites Online rubrics elicitation from pairwise comparisons.

Deep Research as Rubric for Reinforcement Learning Online rubrics elicitation from pairwise comparisons

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-06-28T17:22:25.196101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:133f39e5319b54c52ecfb7518a797c9b153568ecd3f4b54f2ee4bddda6ee23f1

Observation 4117f923-51b9-4dc9-bbe8-0eb643545e28 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Deep Research as Rubric for Reinforcement Learning Constitutional AI: Harmlessness from AI Feedback

Reference 11

Resolution
metadata mismatch
local_arxiv, observed 2026-06-28T17:22:25.205772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:bc02db402501d1ab93c7409a5d36290031c5e8b011fdb444ef746f4309671ac6

Observation 6e8cb5c8-7a52-4cff-aab2-e8887021991f · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

Deep Research as Rubric for Reinforcement Learning Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.217916Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:7761dd1b8094b8b4354d95ecb8561aeed25d046bf99a531f7d2d6f1bbdc94d33

Observation 3f85ff3b-6de0-4164-9839-a75efce56570 · outbound

This paper cites Self-Rewarding Language Models.

Deep Research as Rubric for Reinforcement Learning Self-Rewarding Language Models

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.254132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:80faa95c0d655edda95c2e9b00abd25cf90951177da2534dabe8ec9868562aac

Observation cbb69757-6b27-44c5-853a-7470c156e2be · outbound

This paper cites Yifei, Allen Chang, Chaitanya Malaviya, and Mark Yatskar.

Deep Research as Rubric for Reinforcement Learning Yifei, Allen Chang, Chaitanya Malaviya, and Mark Yatskar

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-06-28T17:22:25.229793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:2e46e45042cbe2a8de6ffe0198abdc3324a6d084b70ba0e39919c80abcec021b

Observation 5155c358-dafc-4720-a626-f8af2e1cefc5 · outbound

This paper cites DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents.

Deep Research as Rubric for Reinforcement Learning DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.262928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:157f0342a7e73a539b0f6afe3c5ba392831bf53f8c3aaca166a6b629782e2c3c

Observation 848a95d9-be29-41db-bd86-63b17b26cdf8 · outbound

This paper cites LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services.

Deep Research as Rubric for Reinforcement Learning LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.240787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:208ff2dce34f693ffad6930f5225d727a92ef3b67906719a2223fe4576d33cd6

Observation d87bd96b-f254-4167-ab32-88a1a02e5d6f · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

Deep Research as Rubric for Reinforcement Learning GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.260671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:e062a9550a303c64c7e82d1bdcd43c4acb1f06bc2f19044980cb7ff74bb2f884

Observation 3cc9edea-ea60-4c30-9f8a-3b0291df48e2 · outbound

This paper cites Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.

Deep Research as Rubric for Reinforcement Learning Mmlu-pro: A more robust and challenging multi-task language understanding benchmark

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:a53dc1bc873472da66b9cec87ba83694601b09c39206be5f3ce17fb4c26a0b35

Observation 23dc7db0-17e9-4eb9-bf0a-36c7003507ba · outbound

This paper cites Measuring massive multitask language understanding.

Deep Research as Rubric for Reinforcement Learning Measuring massive multitask language understanding

Reference 19

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:ef509857270833ad6838d249dc264789dcf77c113b5902cef4aabb9965a2bb09

Observation bba97290-5146-478a-90af-d15bfaaab146 · outbound

This paper cites Qwen3 Technical Report.

Deep Research as Rubric for Reinforcement Learning Qwen3 Technical Report

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.220503Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:f98ba5b98cf4ae1fc16855fe4b17362d29a6a92489acc34d98a53b4e289f76dd

Observation 6687768f-6bdd-4fdf-8518-d9f7a85e1949 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

Deep Research as Rubric for Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.245545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:14721a241d79d7be2f6493b82bacc77d609e6a21049f8cc9075d345c9d717cba

Observation 9821d9a6-fad3-4048-a98a-743e8d7f257d · outbound

This paper cites WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning.

Deep Research as Rubric for Reinforcement Learning WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-06-28T17:22:25.262998Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:df2cfd793779287a9c05bb331098146f6bca6a01f7e934b9509de71d277e3985

Observation 88a9dbb6-e9b6-4cbe-a35a-8e1aaa2ab213 · outbound

This paper cites OpenAI GPT-5 System Card.

Deep Research as Rubric for Reinforcement Learning OpenAI GPT-5 System Card

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.256554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:8c103b70a53ceebd91c90c4037a8f4d6cd32dc415cd03d1a401bea1c865cf411

Observation 6c6e216f-1c95-453f-aa55-18750f45483a · outbound

This paper cites Gemini 3.1 pro model card.

Deep Research as Rubric for Reinforcement Learning Gemini 3.1 pro model card

Reference 24

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:4906eeb162449cfa790b09c79714314adba1ec4a4571d3427c6c7bf99e45ccd5

Observation 54014562-b249-4d55-8e3b-2a83a15dda66 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Deep Research as Rubric for Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.269360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:dd2112901b566f51abe285a04c652a12a7f291fbc40d427908c4d30eb8e55300

Observation 8cec7187-514e-4c1f-bddf-fea4ebe3799e · outbound

This paper cites WebThinker: Empowering Large Reasoning Models with Deep Research Capability.

Deep Research as Rubric for Reinforcement Learning WebThinker: Empowering Large Reasoning Models with Deep Research Capability

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.255714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:71126069009f819096560ce4b16efccacbabeed42f9a498c979453f5f3b09b5a

Observation 44e285c9-dbe7-449c-b9e3-40da58f07dd3 · outbound

This paper cites Tongyi DeepResearch Technical Report.

Deep Research as Rubric for Reinforcement Learning Tongyi DeepResearch Technical Report

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.234975Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:4486d0451b33bbe8edccb4ce46925f88ce13dad48967ce53b4da865f59dcf873

Observation 7dbca3a0-339b-4850-b327-830d3a2e4d52 · outbound

This paper cites DeerFlow: Deep exploration and efficient research flow.

Deep Research as Rubric for Reinforcement Learning DeerFlow: Deep exploration and efficient research flow

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:df9ac37941ca663bb2153e6537f2095d5159b7837774e32251b43e9b289417e0

Observation 738da4a9-0a84-4420-b07f-6d75c523112d · outbound

This paper cites Narasimhan, and Yuan Cao.

Deep Research as Rubric for Reinforcement Learning Narasimhan, and Yuan Cao

Reference 29

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:1f46352058d0f62e6c4fd5160082bfd9ab9ffc6e89d4c02ad83f08a3693c876e

Observation 8012d27c-7e90-4291-b2d3-ccf9558b6322 · outbound

This paper cites an unresolved cited work.

Deep Research as Rubric for Reinforcement Learning Unresolved cited work

Reference 30

Resolution
parse uncertain
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:9c425184d3434e0e76e167387a49f227fd27a564f093f1b66e370971549307d9

Observation c9517785-0bf6-48e1-9394-07be6455558d · outbound

This paper cites Ministral 3.

Deep Research as Rubric for Reinforcement Learning Ministral 3

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-06-28T17:22:25.232087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:2dfc0d776a6b240ce9500e8e48636ccebcbcb5f519c85b4867c875c8e3e08035

Observation 06387279-218c-4fce-9484-efc3897278f5 · outbound

This paper cites Mirothinker-1.7 & h1: Towards heavy-duty research agents via verification.

Deep Research as Rubric for Reinforcement Learning Mirothinker-1.7 & h1: Towards heavy-duty research agents via verification

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-06-28T17:22:25.237850Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:9b07f9985e32eb1b78bf331713b5a219e112354215f6b7acb1ac00b6e57c7151

Observation 39935e55-a2a6-41ca-831f-6b4beb816b50 · outbound

This paper cites 15 System Prompt: Stage II (Rubric Synthesis) # Role Definition You are an expert in evaluation framework design for academic research.

Deep Research as Rubric for Reinforcement Learning 15 System Prompt: Stage II (Rubric Synthesis) # Role Definition You are an expert in evaluation framework design for academic research

Reference 33

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:e2f6c6dd92e70f27bd31502eee8bdfec7913a57e523b34f98c70697d8fef502d

Observation c357a92e-209b-4ac7-b756-d09db642d14e · outbound

This paper cites This report contains the necessary factual information (algorithms, parameters, benchmarks, etc.) that a high-quality responseshouldcontain.

Deep Research as Rubric for Reinforcement Learning This report contains the necessary factual information (algorithms, parameters, benchmarks, etc.) that a high-quality responseshouldcontain

Reference 34

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:2cb9172e947000fa5cc08ebe4b7961aec8cc1f999daaa5a14558ac43e90fd099

Observation 9eb1a042-58c3-480d-852c-c5df007ad39a · outbound

This paper cites Prohibited Content:.

Deep Research as Rubric for Reinforcement Learning Prohibited Content:

Reference 35

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:b6a11bb7dc0fd264b25ed8621114d0b972f8dbd120414d2cbea564f5b23ed276

Observation c1d1d5c3-33f1-46d8-9339-2d75ec8ad8c3 · outbound

This paper cites an unresolved cited work.

Deep Research as Rubric for Reinforcement Learning Unresolved cited work

Reference 36

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:37a82e1d5361f50e689b59c38b775af16ff31141ca3a63af7d7693053e7eb823

Observation faeef9c8-f511-4659-940b-59175fcded02 · outbound

This paper cites an unresolved cited work.

Deep Research as Rubric for Reinforcement Learning Unresolved cited work

Reference 37

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:73792cc92d6041a8eb659ffee89671727399af9508688262aec7d66cfa36fe1c

Observation 3cdd257f-5e00-4301-a97e-7a0fa58140f3 · outbound

This paper cites >=[X] specific algorithms included.

Deep Research as Rubric for Reinforcement Learning >=[X] specific algorithms included

Reference 38

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:01b5bacd36fd57a2e940af1ca7516093ec33f82cddb32dbe92cbcccf01f1d690

Observation 530da140-3af1-47d5-9af4-bcbe9578a6d2 · outbound

This paper cites #### Core Dimension:.

Deep Research as Rubric for Reinforcement Learning #### Core Dimension:

Reference 39

Resolution
malformed identifier
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:b8b24e2a885ad263c84e0f10d6d1ed708aa5b2a212bba26e726077be907b5e1a

Observation 7642a616-1f32-43a3-b269-9e3947dd9f70 · outbound

This paper cites Stop ifP n >max(0.15,2×P n−1).

Deep Research as Rubric for Reinforcement Learning Stop ifP n >max(0.15,2×P n−1)

Reference 40

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:59b23db6e727dbd52196a34548dc70cffa09d283c5d994747da1622521f7e9f4

Observation 4d4faf62-6194-4773-ad17-b23b647fac37 · outbound

This paper cites an unresolved cited work.

Deep Research as Rubric for Reinforcement Learning Unresolved cited work

Reference 41

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:4df518b63d9d994234f969166342c20292a9c24d0d2fa1dd66e65fd475017c8b

Observation 5a4d200d-0955-4ddd-94f3-dcd863013a83 · outbound

This paper cites Retrospective validation on both scales: this rule correctly selects BS-2 and terminates at BS-3, avoiding BS-4/BS-5 and saving 40–60% of total bootstrap compute.

Deep Research as Rubric for Reinforcement Learning Retrospective validation on both scales: this rule correctly selects BS-2 and terminates at BS-3, avoiding BS-4/BS-5 and saving 40–60% of total bootstrap compute

Reference 42

Resolution
unresolved
no resolver link, observed 2026-06-28T17:16:16.243967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-28T17:16:16.243967Z digest=sha256:8b124803a8b6d424b01a6b9975e2fb85d7cd0cf149fce5dddd0906dcac45b4c7

Pith citing papers

Observation 52111dd3-7d53-42c2-8a8e-8c4deb7fa28d · inbound

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents cites this paper.

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents Deep Research as Rubric for Reinforcement Learning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T15:12:55.560232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T15:12:55.560232Z digest=sha256:2b84987e94817f8a9db55f1b8505cf6678a34082b5b3f05d9aef17538b109de6