Pith. sign in

Paper Citation Record · LEDGER

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation

As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2605.21482.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.21482 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-21T03:53:41.053206Z

measured 59 of 59 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T15:12:55.627208Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

58 of 58 outbound references displayed

  • verified exact3
  • verified fuzzy50
  • unresolved4
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e7f07880-7b1b-4f9d-9e82-27904ecbee62 · outbound

This paper cites an unresolved cited work.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-05-21T03:53:56.370774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:e567e3e38b91bebef490119f4ceddd210be8d6fa7ae224d28995fe79175c6075

Observation c9b3ac1f-bac2-4026-bb32-601ee54ec59e · outbound

This paper cites Claude code.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Claude code

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.381873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:0e28c3687c0411ce0bbd7527f49f2caad11e010ce053d3722b5a5cfbb8f0a1d6

Observation 5d5cc67b-e03f-44d0-acb1-1295b74d7ecf · outbound

This paper cites Claude takes research to new places.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Claude takes research to new places

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.444454Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:73c70759a5cd67f7c3c6cf8c46458d579adfc416a2233b12ba47788fb6135c36

Observation 83af2968-938a-4f0f-8c9e-91f5cb503cd3 · outbound

This paper cites Introducing claude opus 4.7.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Introducing claude opus 4.7

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.440447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:70119a98efe96afa01c5f74c2687e465b0da7df9adc0b8b014e26ea308a76050

Observation b1bb846b-8ed8-448d-a336-38e68f7dd230 · outbound

This paper cites Introducing claude sonnet 4.6.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Introducing claude sonnet 4.6

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.444687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:3bfdb36adc2664e4d4f6033b876f2eeec4ca97bfc07dc0b890259f9d053f43f5

Observation 0fc8e606-9a60-41bb-b278-8edf08a24c12 · outbound

This paper cites Synthesizing scientific literature with retrieval-augmented language models.Nature, pages 1–7.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Synthesizing scientific literature with retrieval-augmented language models.Nature, pages 1–7

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.414300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:b7e94ba904ce321183f9adf2a814158993f02a25bbf92c58660824220a61007f

Observation 7897af27-0ee9-4ba8-8198-42141db8d54a · outbound

This paper cites an unresolved cited work.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-05-21T03:53:56.410442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:6cdeb7ea0227fe9aeecff72642448191785e0727067fa7c0bcdfe5e2e8103155

Observation 945a8123-da16-456a-b226-58b07a2c59f0 · outbound

This paper cites MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.435302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:6f9d044d98c1368e41359887ce8c8f601617d53500cdb8db796fced0789c0036

Observation 522e6399-c509-49af-b2d8-b72851f61c0d · outbound

This paper cites Evaluating Large Language Models Trained on Code.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Evaluating Large Language Models Trained on Code

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-21T03:53:56.144160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:93f00a2a11ff43d320896f315a4cb6769bed24b2ed48a77db8ca2ffaae629fe7

Observation 1c2b10c5-842a-48ab-ae1c-d571ca2bbee6 · outbound

This paper cites Mind2web: Towards a generalist agent for the web.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Mind2web: Towards a generalist agent for the web

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.366424Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:1cc0b9a3888dab62b505ad3408d73b70387ff619f405c6422973a54c9c1ed117

Observation f5004043-ec94-4411-b6f8-6a0d80967507 · outbound

This paper cites Deepresearchgym: A free, transparent, and reproducible evaluation sandbox for deep research.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Deepresearchgym: A free, transparent, and reproducible evaluation sandbox for deep research

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-21T03:53:56.138334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:1952dae2bc4ccffb8d99a79bc7db17d25ef89e37a094c9675095a11d28ec4a6c

Observation 1f20a2fa-7630-48b9-9b8f-6613b7a4be7b · outbound

This paper cites Deepseek v4 preview release.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Deepseek v4 preview release

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.383941Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:c272f9f5dac16eac66b3f5962c036ee54417d6211c7afc60770150d243087ec5

Observation ecc7a1d8-639a-4bbc-aaa0-43c66eb6abca · outbound

This paper cites Deepresearch bench: A comprehensive benchmark for deep research agents.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Deepresearch bench: A comprehensive benchmark for deep research agents

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.391957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:da26725c3871a2fa3ae17c0ba21fac312c29aef2bdba48778507b0618cfa6ad1

Observation 389e62e2-f33d-4f65-89ef-e5242298549d · outbound

This paper cites ai 1 Gatti Alice 1 Li Nathaniel 1 Khoja Adam 1 Kim Ryan 1 Ren Richard 1 Hausenloy Jason 1 Zhang Oliver 1 Mazeika Mantas 1 Hendrycks Dan dan@ safe.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation ai 1 Gatti Alice 1 Li Nathaniel 1 Khoja Adam 1 Kim Ryan 1 Ren Richard 1 Hausenloy Jason 1 Zhang Oliver 1 Mazeika Mantas 1 Hendrycks Dan dan@ safe

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.416157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:d1c1894acd4793a7689fb7a3cb0c824743e1711c0e7e8615617d73c50314c70c

Observation 92f1e3f9-aac7-4c2a-9c8a-3f1de76b59d8 · outbound

This paper cites Gemini: Try deep research and gemini 2.0 flash experimental.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Gemini: Try deep research and gemini 2.0 flash experimental

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.406600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:2afae99ace1f12ab8e84dc1cc6e2d2fb51d06e07c88f4cae19dd31525db5a617

Observation 147496c8-dc87-4bd1-8a95-968530998e69 · outbound

This paper cites Mind2web 2: Evaluating agentic search with agent-as-a-judge.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Mind2web 2: Evaluating agentic search with agent-as-a-judge

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.454001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:49e9d173f429d0dbc2c05bb70fa09fb553887b60f400435e6a768cb9031fcc47

Observation c8df9601-a81a-4459-984d-c69f29790b47 · outbound

This paper cites Deepsearchqa: Bridging the comprehensiveness gap for deep research agents.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Deepsearchqa: Bridging the comprehensiveness gap for deep research agents

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.417383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:40fb091bf3a7c60a99d8c0750ecf96d3c6ec80bc9ea949215ed51beefe3de9cc

Observation 20798bb5-f860-4828-9f54-095b530351a0 · outbound

This paper cites Livecodebench: Holistic and contamination free evaluation of large language models for code.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Livecodebench: Holistic and contamination free evaluation of large language models for code

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.427354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:729248a404b87891eb7cddc18670fe2729cd9da1b106745898e111bbdf26308d

Observation 828645ed-e8b2-4a2d-82f6-bd70d1b7d385 · outbound

This paper cites Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.459621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:ebff5e1987feca26806b011c7184e8bb7d0831ca12154e307e7b3976570ef617

Observation b2b409fd-50b8-4c6c-8e54-24d3b2fa151d · outbound

This paper cites an unresolved cited work.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-05-21T03:53:56.450143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:776001a019cd73a32ba6b4c94d02717b49cb3ec4817059a696c982c3582746eb

Observation 65e3481e-39b0-4f39-97e3-a52e4ba65592 · outbound

This paper cites Deepresearch bench ii: Diagnosing deep research agents via rubrics from expert report.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Deepresearch bench ii: Diagnosing deep research agents via rubrics from expert report

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-21T03:53:56.141482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:e0953ef8bc91bbc2b5678e22a5dd0712d29d7fcfec17a134806d981ff3e8d9f6

Observation 1f7ac2ef-ae68-4dfa-baf9-464e87e8a031 · outbound

This paper cites Gonzalez, and Ion Stoica.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Gonzalez, and Ion Stoica

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.437142Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:b2d8332eecfdbb8be86f420b5b1e82efb3939f47d041d910b5491b963ae64a50

Observation a45f4968-46d7-44f6-bd8e-5506a9e35c06 · outbound

This paper cites Autobencher: Towards declarative benchmark construction.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Autobencher: Towards declarative benchmark construction

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.455927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:ac9eddae085a38198d52b83fbde6dd8c4bde237a1b39a4eeeaf6551c326ff843

Observation 9c1ae438-edd2-43e7-8ce0-c2bfe2dabcdc · outbound

This paper cites OpenResearcher: A fully open pipeline for long-horizon deep research trajectory synthesis.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation OpenResearcher: A fully open pipeline for long-horizon deep research trajectory synthesis

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.442535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:bd9d02a84b2593cb2380481a2425c23d923609983a5c8e6bc7841544280302cf

Observation 8934e999-baf1-482c-b75a-0629bb9e0c59 · outbound

This paper cites Wildbench: Benchmarking llms with challenging tasks from real users in the wild.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Wildbench: Benchmarking llms with challenging tasks from real users in the wild

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.446406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:5c1a0e426e8fd45a3764657d07b36b2d64929f0a5d66892309da5d85b865b4fe

Observation 56e5febc-3589-4d28-92a4-8333531869d0 · outbound

This paper cites Agentbench: Evaluating llms as agents.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Agentbench: Evaluating llms as agents

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.434835Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:ea7bf1992c512a9570d9df9903df405368d9047a4a5e3d4c69eb04525ac46ca0

Observation d12d6ada-ccfd-4e64-95b5-2e66cc1cc34b · outbound

This paper cites Toolsandbox: A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Toolsandbox: A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.436884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:d93bbbe1ed64e71695c33f80c6d289aafe2d5c59bcdf1f938ef149d9feeb7e61

Observation 6120caf4-1536-478a-b777-aa91894387ef · outbound

This paper cites Merrill, Alexander G.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Merrill, Alexander G

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.440962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:035ef923a2f7dba9bafec9b7a2918be45bfa35008f09f88522688fb173dff3fb

Observation b12c4eda-344e-4bda-b190-1cb4f45d9555 · outbound

This paper cites Gaia: a benchmark for general AI assistants.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Gaia: a benchmark for general AI assistants

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.448306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:0ab4ca22f31e568922465eb3ef67c1fab0dfb9c16e72179b4b21542a50247839

Observation 4d736b59-de32-41ec-aac2-93dd1ae41dfe · outbound

This paper cites Minimax m2.7.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Minimax m2.7

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.419353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:5fa330b6a332076a7f9832660d5a01adbe002b4dd4e93e3cc7e18f2e1fbda6d1

Observation b3589db2-d955-45d5-940b-811b7ee55429 · outbound

This paper cites Kimi researcher.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Kimi researcher

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.431198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:fffea0093febcd640a3327f1eba621a2b45ac87932821c26b48c4e58666b0f9d

Observation 26be7107-094c-495c-8b5e-96e9db3e7cca · outbound

This paper cites Kimi k2.6.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Kimi k2.6

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.407701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:b92b53cc71bad3a0c1099e85f98ee2b69870414e202755004e18b76b1a79444f

Observation 9acb3002-0399-4b6b-8cd0-ff7465ebd26f · outbound

This paper cites Codex cli.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Codex cli

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.421458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:acf8bd665b9109ca3c7895f43d86ebb26149c3b9a6e2ce9790758c5311cdf980

Observation 0da1ca6d-d296-4b3b-a3b4-dc3ab7918eaa · outbound

This paper cites Introducing deep research.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Introducing deep research

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.423552Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:c8e43e5bb2d6cabb8391500298f425f88a4639ed54577f608c8d82e8972d0a62

Observation 70f26a93-73e3-4e07-bfd7-ba7470e94889 · outbound

This paper cites Introducing gpt-5.5.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Introducing gpt-5.5

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.425344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:23210fcacdfd27180795ca483e2e5b77e0a65a110a08f8137c3399d0c5491b80

Observation a3ed035e-4ef7-4a07-937b-c215848c795e · outbound

This paper cites Gonzalez.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Gonzalez

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.432921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:06df548629a2da44c3a6f67f571ce03103a43dad32500b57d244d41b63069892

Observation 2d499299-ea30-4fb7-be71-64c001a0ade7 · outbound

This paper cites Introducing perplexity deep research.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Introducing perplexity deep research

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.457732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:911ddf51e2b36965324706359436d5c4a9e4f402d94c92c0cd53629118fda0ee

Observation e4dddd28-573b-491d-8c3d-f36c5fdb2993 · outbound

This paper cites Qwen3.6-plus: Towards real world agents.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Qwen3.6-plus: Towards real world agents

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.413220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:d20b6a22c10942da3243066e13600f00f05f5528defd1d7ad2dec51a6c80b9ac

Observation 43fc4930-b197-4278-be47-26892d5361f5 · outbound

This paper cites an unresolved cited work.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-05-21T03:53:56.409495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:abed55007474778f8b9d3588f63b1c9c2493ffa2b35146e6f6253c8fa98e88a7

Observation 3bc9f27b-605a-4464-948c-49276397095d · outbound

This paper cites Appworld: A controllable world of apps and people for benchmarking interactive coding agents.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Appworld: A controllable world of apps and people for benchmarking interactive coding agents

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.411378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:ad7ad501d9f8b77e99c7640cdcc1002338be07ee973361d3b7ec42e4d806df66

Observation 3397a8ab-7e37-4a6f-b490-21135dd7fe53 · outbound

This paper cites Liveresearchbench: A live benchmark for user-centric deep research in the wild.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Liveresearchbench: A live benchmark for user-centric deep research in the wild

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.415305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:7bc5f0c403cd651e234ad8c0fc1de8987faa5143e1b1e56e43150188578088db

Observation fe0b2868-c3c4-4547-af16-de074edc98a7 · outbound

This paper cites Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, Hoang H.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, Hoang H

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.429360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:092add73f82d1467b404b5ce1c2bfb1445856101c150bd02aa3eb485f0605f1b

Observation 56e70b88-a114-4d1d-8150-843d8785974d · outbound

This paper cites Measuring short-form factuality in large language models.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Measuring short-form factuality in large language models

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.451957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:1f7dd1f598c446294f26b9c67e590151bc9f041403d9fbd29e4308536e1916c7

Observation e015db3d-5889-496e-b574-98cef9c9be4a · outbound

This paper cites Browsecomp: A simple yet challenging benchmark for browsing agents.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Browsecomp: A simple yet challenging benchmark for browsing agents

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.399933Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:4d4b993e1af6cce9f7f934f9ea1fe71a7f536acf0ec0ae2cc9be0cd4fe148d24

Observation 035b040a-d83c-4abb-a803-18f7dbbea62c · outbound

This paper cites Widesearch: Benchmarking agentic broad info-seeking.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Widesearch: Benchmarking agentic broad info-seeking

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.412272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:847368e966004b164efcc3318c7006938a8e093b059c03f43c17ed2e292aec70

Observation 15e2472e-144a-4b12-8e54-7f5c7f0c1534 · outbound

This paper cites Webwalker: Benchmarking LLMs in web traversal.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Webwalker: Benchmarking LLMs in web traversal

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.398046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:1f65967154283a4783535f09b18d380bc36477bd6e3efd61030b3a1f21f66f64

Observation c6a035e8-4361-43ca-bbb3-df176fb989b7 · outbound

This paper cites DeepResearch-9K: A challenging benchmark dataset of deep-research agent.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation DeepResearch-9K: A challenging benchmark dataset of deep-research agent

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.403727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:b4318ca9986a43c7cf12d79ee16d02097c5eb077264be50ef6fab057aeaa9c23

Observation 118d18be-0b79-4525-b9cc-7ef12e96ef35 · outbound

This paper cites Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.446572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:a563df4303b2771cd66cc6e45c9c4fc52e98d1a3177294f730d557e43cb10f41

Observation be86de82-130d-4070-a7d5-de295fb40369 · outbound

This paper cites SWE-agent: Agent-computer interfaces enable automated soft- ware engineering.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation SWE-agent: Agent-computer interfaces enable automated soft- ware engineering

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.399045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:f40e51164d2e4669207db5128018f2deab7d5b56a8d17e86c9ca5f3a8e42d1ef

Observation d905eb25-cb62-4624-99a4-65e1ce93f0bf · outbound

This paper cites τ-bench: A benchmark for tool-agent-user interaction in real-world domains.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation τ-bench: A benchmark for tool-agent-user interaction in real-world domains

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.395426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:a666815c42cf30e134b5e455a7e09b616adfdc9a73a6adf8f26ac83983f938ec

Observation 97cabf09-9267-4b5a-98bb-3a7d7a49f95f · outbound

This paper cites AutoResearchBench: Benchmarking AI agents on complex scientific literature discovery.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation AutoResearchBench: Benchmarking AI agents on complex scientific literature discovery

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.423743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:d92386c3979fed90c371fcbac994b772252f1cfa7bf0c92ff0a24315868f40c0

Observation 69f13707-dfc0-452a-837a-15f3bbcf0477 · outbound

This paper cites Retrieval augmented fact verification by synthesizing contrastive arguments.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Retrieval augmented fact verification by synthesizing contrastive arguments

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.385859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:61ad866ea72bf6f2f2efc4e1f2e96c165ebcca36ba3c50100e014eccb45ac600

Observation 594e2a7c-7270-4d34-893b-651f00781ae1 · outbound

This paper cites GLM-5.1 overview.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation GLM-5.1 overview

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.390008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:a9dce476743dd70200602f827339e614934ae38fdd335d7bd12a3dd947f03432

Observation 57422f94-a145-42ae-ae46-51a4473a0e97 · outbound

This paper cites Benchmarking data science agents.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Benchmarking data science agents

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.396110Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:eaf64c4a0efb91e85d18b9513bde80c9fc9712a7b825335719b4e378df59f7b1

Observation 253cecdc-7bcb-4b7f-8dc9-352fd66fa5e4 · outbound

This paper cites Xing, Hao Zhang, Joseph E.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Xing, Hao Zhang, Joseph E

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.401739Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:32ee1c5eb25e09359f99941616ca35e76fd1bb9d7927fdadb1db31ff5a2a76d8

Observation b5c25d08-11e9-4a08-b802-5fefb8657d4a · outbound

This paper cites Draco: a cross-domain benchmark for deep research accuracy, completeness, and objectivity.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Draco: a cross-domain benchmark for deep research accuracy, completeness, and objectivity

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.391499Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:8865f720d1ea2bc176d937e8785ef806c3b21967b43b9f1ec555ff4c3ef1f958

Observation f309b051-1586-400e-a92a-27d16328c8d4 · outbound

This paper cites Browsecomp-zh: Benchmarking web browsing ability of large language models in chinese.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation Browsecomp-zh: Benchmarking web browsing ability of large language models in chinese

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T03:53:56.393459Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:d83280262aad98d63db48c7fe0fcdaf1ce72cc0b5bf777d45f81cd25c5bd82b4

Observation f82cb579-efe2-4f35-810e-d7472b99ae53 · outbound

This paper cites not available.

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation not available

Reference 58

Resolution
malformed identifier
raw_fallback, observed 2026-05-21T03:53:56.400730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T03:53:41.053206Z digest=sha256:38af1a2dc5053e07196d213a145d3a4babd18d27b19514106ff7abfa2ed48fd5

Pith citing papers

Observation fcb55896-0641-4add-b437-13301b4bd4db · inbound

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents cites this paper.

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-04T15:12:55.627208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T15:12:55.627208Z digest=sha256:48941d97584102d07909363792e6a2fb7e5b74f594bac31b140921b9fd49af42