Pith. sign in

Paper Citation Record · LEDGER

ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2508.15804.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.15804 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 13 of 13 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 13 of 13 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T00:22:58.884828Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation bdeab335-c9da-42f9-b11e-4ff36007e409 · inbound

How Adversarial Environments Mislead Agentic AI? cites this paper.

How Adversarial Environments Mislead Agentic AI? ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T12:11:07.718136Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-10T04:04:41.152756Z digest=sha256:2500a38e3fcf109e8f81497d566c271b6fe210c713210a25e20701786afc4eb7

Observation 1d8d5f3f-c906-4727-a5b8-61bc406facc8 · inbound

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics cites this paper.

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 12

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T02:11:16.023052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T02:07:39.648269Z digest=sha256:d81747b0892086b14b4f65a09f45196b1dfa690f8f4bc10b95db36c38f68f49d

Observation fe585871-120e-480a-8c5b-d85aed7880a2 · inbound

AI for Auto-Research: Roadmap & User Guide cites this paper.

AI for Auto-Research: Roadmap & User Guide ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 103

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:33:12.766594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-20T10:30:50.256635Z digest=sha256:705bc403c77331726d349f8b5305580fc71b9c57f8a0edecf400ed3c4de227c4

Observation 3c7b53dd-ecea-491f-b0c6-531e11b12ae2 · inbound

AI for Auto-Research: Roadmap & User Guide cites this paper.

AI for Auto-Research: Roadmap & User Guide ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 103

Resolution
unresolved
no resolver link, observed 2026-08-02T13:43:37.843484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T13:43:37.843484Z digest=sha256:5e6aaaba280d987edbfbf69ea1774faafc09e79bd6ef94dcd44b55f7dc9428c8

Observation 63874281-696b-42b9-ba4b-30048d32597d · inbound

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? cites this paper.

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:18:11.803436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-20T10:15:37.280308Z digest=sha256:061fb3a688188d7812b9ca76749ac0005c8debebd5e6296412f5c207ff9dddbe

Observation ce938068-7677-442d-aafd-00d753d2714f · inbound

Can AI Agents Synthesize Scientific Conclusions? cites this paper.

Can AI Agents Synthesize Scientific Conclusions? ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 67

Resolution
verified exact
arxiv_id, observed 2026-07-03T05:47:41.464352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-27T13:05:07.718882Z digest=sha256:3d88a6a303a7389144cc1f44aa35f7e92fc921f3c75ecc8d6027240640736551

Observation 23d8e122-682a-449b-8338-2bebfcf18d13 · inbound

Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application cites this paper.

Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 80

Resolution
verified exact
arxiv_id, observed 2026-06-27T09:50:48.558404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-27T09:46:30.702256Z digest=sha256:2f0beab0718c81c8ee1c3d9134de8525f6addec8f6223aafe39fa2689a30a6b8

Observation c109b3bd-556f-4c9f-9fee-b656683dbbea · inbound

Lacuna: A Research Map for Machine Learning cites this paper.

Lacuna: A Research Map for Machine Learning ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T16:09:57.429847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-26T00:51:24.834719Z digest=sha256:1066540f1be4048e2969956addbbc33ea3ce82560da7e9c160e28a107311e778

Observation 5055cc52-ed68-4162-a2ef-3e885940b6e0 · inbound

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports cites this paper.

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-01T09:12:23.111579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T09:12:23.111579Z digest=sha256:2454396b09f5d55af167174c7db01435456036dea6b4f7cd056c0bfa9a9eb432

Observation 5bfb1fb4-55e5-4704-af5a-e5a7138abfa0 · inbound

Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis cites this paper.

Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-30T20:14:27.112809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T20:14:27.112809Z digest=sha256:2365184698367243c19d081b9a0db1b8b747c140166029a9c1cf77c3bd535d34

Observation 10752821-d4e1-44bf-90eb-44ffccd332c5 · inbound

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research cites this paper.

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-31T00:05:16.749966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T00:05:16.749966Z digest=sha256:a5db84f62256214ddd17aa92d5cb40b7758d1c9559c8e93eaf5a857aae82ffe4

Observation 590e4f03-85f8-4884-8aa2-fec5936a469f · inbound

FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction cites this paper.

FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T00:22:58.884828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T00:22:58.884828Z digest=sha256:f063333140bb6e72e08f8b4931e5ddb22d338c51782eff04599a8e1ae27dd03f

Observation ea6935a7-5399-4696-a958-6549381a1da9 · inbound

From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution cites this paper.

From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T13:31:21.958519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:31:21.958519Z digest=sha256:03b4f311f5edf4a43450a96fbc56314f9badf40e09c0baaf4b90dd16b3462f78