Pith. sign in

Paper Citation Record · LEDGER

Deep Research Bench: Evaluating AI Web Research Agents

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2506.06287.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.06287 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 12 of 12 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T04:43:23.463534Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-25T04:50:21.684667Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation bec7f51e-b3bc-4c3f-957b-2dffb5b8ca45 · inbound

Bench to the Future: A Pastcasting Benchmark for Forecasting Agents cites this paper.

Bench to the Future: A Pastcasting Benchmark for Forecasting Agents Deep Research Bench: Evaluating AI Web Research Agents

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T04:43:23.463534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:43:23.463534Z digest=sha256:e662aa932fe1e1423b3a6da8f1b0f488d1dfd529c0254565e9f77cb41b8f4efd

Observation e760e549-c48e-4a8e-802d-09ddafef1def · inbound

A Survey of Context Engineering for Large Language Models cites this paper.

A Survey of Context Engineering for Large Language Models Deep Research Bench: Evaluating AI Web Research Agents

Reference 87

Resolution
verified exact
arxiv_id, observed 2026-05-13T20:58:45.494330Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-13T20:58:45.060041Z digest=sha256:f7762cb59848c17d7152410e97781cd16bc7f1c2888e808171ec27846f250dca

Observation a7be4d39-beda-43fd-811e-3deddc64d4a5 · inbound

Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts cites this paper.

Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts Deep Research Bench: Evaluating AI Web Research Agents

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T14:22:31.357022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T14:22:31.357022Z digest=sha256:d5b0936a8ac88bd7126c956e32714662a19385f877de4de8afbdd97f4bee7446

Observation 9eb6e252-b576-4a9b-83d2-4dc6fe297981 · inbound

Characterizing Deep Research: A Benchmark and Formal Definition cites this paper.

Characterizing Deep Research: A Benchmark and Formal Definition Deep Research Bench: Evaluating AI Web Research Agents

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T00:56:03.602916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T00:56:03.602916Z digest=sha256:8a613a32d2d19f3e5ba573c7ec8d4ff953143659b522d884a226331a9154493e

Observation 8587929c-a81f-45af-a2bb-4ff14eaefd61 · inbound

DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence cites this paper.

DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence Deep Research Bench: Evaluating AI Web Research Agents

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T12:11:33.637116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:11:33.637116Z digest=sha256:056c029211869f3ad4dbe34cfa6c13de7d6bcb5157b9f269cb77ca4444cd8e25

Observation 04233726-81f8-4367-827f-3c8e2afee05d · inbound

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services cites this paper.

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services Deep Research Bench: Evaluating AI Web Research Agents

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T18:00:22.112227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T18:00:22.112227Z digest=sha256:cdabfa82a9fef08b9c5139bfb00a50a72b326ca7563eb9b2ffa747658ecaa6be

Observation 3a52d6b8-ca8f-4289-a004-aa48765ec161 · inbound

SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning cites this paper.

SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning Deep Research Bench: Evaluating AI Web Research Agents

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-11T17:01:08.394021Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-09T14:18:14.048230Z digest=sha256:8e58fac636607a40a749addb48e9d72cf5131854d3f8b9746ec1d49fa24aaada

Observation d674251d-08dc-453e-9ccb-4fc6b1ba57ec · inbound

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics cites this paper.

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics Deep Research Bench: Evaluating AI Web Research Agents

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T02:11:16.030282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T02:07:39.648269Z digest=sha256:50f482b069eab483c71285b69604be9404d15cac93f1b3f1ca1ef29ee375b2e0

Observation 0caa09fe-b545-48a3-9d4b-96c4ce779b96 · inbound

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? cites this paper.

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? Deep Research Bench: Evaluating AI Web Research Agents

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:18:11.859311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-20T10:15:37.280308Z digest=sha256:ec4042267714d79d0ce576aec02ac6a16e13811f19f24c2bdecb264c6fe8b880

Observation 2c2ea197-9afb-4156-b804-ff08992244ed · inbound

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery cites this paper.

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery Deep Research Bench: Evaluating AI Web Research Agents

Reference 128

Resolution
verified exact
arxiv_id, observed 2026-05-25T04:50:21.689384Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-25T04:46:43.679185Z digest=sha256:38ed428b59891a8dd6e753648be3ea4ad525bf01d55f0b29a38f6443f39c3852

Observation 9cb59fbd-a252-4bc5-8930-1e6e3d80865a · inbound

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting cites this paper.

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting Deep Research Bench: Evaluating AI Web Research Agents

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-01T16:11:33.698186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T16:11:33.698186Z digest=sha256:b95504d09e8af738d26799794cb5342242f64b1bc555f60b8c4f61071083f710

Observation c8835e40-bd78-4d43-9c99-e4e885aecb1c · inbound

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports cites this paper.

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports Deep Research Bench: Evaluating AI Web Research Agents

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T09:12:23.215495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T09:12:23.215495Z digest=sha256:e927b7e2d2611e3fe87ccafe7639de0db57c426006f11818dc011873624ba3cd