{"as_of":"2026-08-14T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c2d1b037d4588f427cc33fa669e54a2a93be4340e6246fb60abeb946ac0f3d4","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T03:53:41.053206Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:12:55.627208Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21482","snapshot_observed_at":"2026-08-04T15:12:55.627208Z","title":"2026 , archivePrefix =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-12T14:34:18.545300Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.627208Z"},"links":{"cited_paper":"/paper/2605.21482","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:48941d97584102d07909363792e6a2fb7e5b74f594bac31b140921b9fd49af42","observation_id":"fcb55896-0641-4add-b437-13301b4bd4db","resolution":{"observed_at":"2026-08-04T15:12:55.627208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.21482/citation-record","integrity":"/paper/2605.21482/integrity","json":"/paper/2605.21482/citation-record.json","paper":"/paper/2605.21482"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a6565290-3de8-4066-9eb9-f69237271224","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:e567e3e38b91bebef490119f4ceddd210be8d6fa7ae224d28995fe79175c6075","observation_id":"e7f07880-7b1b-4f9d-9e82-27904ecbee62","resolution":{"observed_at":"2026-05-21T03:53:56.370774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude code","venue":null,"work_id":"deca7395-f7af-4c9a-ba40-b566ec4cb7eb","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:0e28c3687c0411ce0bbd7527f49f2caad11e010ce053d3722b5a5cfbb8f0a1d6","observation_id":"c9b3ac1f-bac2-4026-bb32-601ee54ec59e","resolution":{"observed_at":"2026-05-21T03:53:56.381873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude takes research to new places","venue":null,"work_id":"1c378f84-e664-460c-bf2b-dde2a223c85a","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:73c70759a5cd67f7c3c6cf8c46458d579adfc416a2233b12ba47788fb6135c36","observation_id":"5d5cc67b-e03f-44d0-acb1-1295b74d7ecf","resolution":{"observed_at":"2026-05-21T03:53:56.444454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing claude opus 4.7","venue":null,"work_id":"905e3fb0-6605-4b4f-93df-5934f4b721e9","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:70119a98efe96afa01c5f74c2687e465b0da7df9adc0b8b014e26ea308a76050","observation_id":"83af2968-938a-4f0f-8c9e-91f5cb503cd3","resolution":{"observed_at":"2026-05-21T03:53:56.440447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing claude sonnet 4.6","venue":null,"work_id":"e8cc1637-e388-4a88-926b-024e78650150","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:3bfdb36adc2664e4d4f6033b876f2eeec4ca97bfc07dc0b890259f9d053f43f5","observation_id":"b1bb846b-8ed8-448d-a336-38e68f7dd230","resolution":{"observed_at":"2026-05-21T03:53:56.444687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthesizing scientific literature with retrieval-augmented language models.Nature, pages 1–7","venue":null,"work_id":"ed6f0b12-89a9-49a9-a84b-589827594657","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:b7e94ba904ce321183f9adf2a814158993f02a25bbf92c58660824220a61007f","observation_id":"0fc8e606-9a60-41bb-b278-8edf08a24c12","resolution":{"observed_at":"2026-05-21T03:53:56.414300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8315d505-4704-44c7-9b0b-b4b10ac70cbd","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:6cdeb7ea0227fe9aeecff72642448191785e0727067fa7c0bcdfe5e2e8103155","observation_id":"7897af27-0ee9-4ba8-8198-42141db8d54a","resolution":{"observed_at":"2026-05-21T03:53:56.410442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research","venue":null,"work_id":"8282984b-c7bf-4759-9100-2ae9468a56a0","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:6f9d044d98c1368e41359887ce8c8f601617d53500cdb8db796fced0789c0036","observation_id":"945a8123-da16-456a-b226-58b07a2c59f0","resolution":{"observed_at":"2026-05-21T03:53:56.435302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:93f00a2a11ff43d320896f315a4cb6769bed24b2ed48a77db8ca2ffaae629fe7","observation_id":"522e6399-c509-49af-b2d8-b72851f61c0d","resolution":{"observed_at":"2026-05-21T03:53:56.144160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"871bc16d-c718-411f-b25b-776d1ae65f87","year":2023},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:1cc0b9a3888dab62b505ad3408d73b70387ff619f405c6422973a54c9c1ed117","observation_id":"1c2b10c5-842a-48ab-ae1c-d571ca2bbee6","resolution":{"observed_at":"2026-05-21T03:53:56.366424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19253","doi":"10.48550/arxiv.2505.19253","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepresearchgym: A free, transparent, and reproducible evaluation sandbox for deep research","venue":"ArXiv.org","work_id":"2f6b8cd2-51ef-4670-8361-26e737e919cf","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:1952dae2bc4ccffb8d99a79bc7db17d25ef89e37a094c9675095a11d28ec4a6c","observation_id":"f5004043-ec94-4411-b6f8-6a0d80967507","resolution":{"observed_at":"2026-05-21T03:53:56.138334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek v4 preview release","venue":null,"work_id":"740fd2a9-b5d1-4ddd-a4ed-bf6f6f01abd7","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:c272f9f5dac16eac66b3f5962c036ee54417d6211c7afc60770150d243087ec5","observation_id":"1f20a2fa-7630-48b9-9b8f-6613b7a4be7b","resolution":{"observed_at":"2026-05-21T03:53:56.383941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepresearch bench: A comprehensive benchmark for deep research agents","venue":null,"work_id":"0d8e91eb-d88e-4810-98c9-301b53c8f7be","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:da26725c3871a2fa3ae17c0ba21fac312c29aef2bdba48778507b0618cfa6ad1","observation_id":"ecc7a1d8-639a-4bbc-aaa0-43c66eb6abca","resolution":{"observed_at":"2026-05-21T03:53:56.391957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ai 1 Gatti Alice 1 Li Nathaniel 1 Khoja Adam 1 Kim Ryan 1 Ren Richard 1 Hausenloy Jason 1 Zhang Oliver 1 Mazeika Mantas 1 Hendrycks Dan dan@ safe","venue":null,"work_id":"e1285ef4-2673-499f-ba0f-9024e55b6bf6","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:d1c1894acd4793a7689fb7a3cb0c824743e1711c0e7e8615617d73c50314c70c","observation_id":"389e62e2-f33d-4f65-89ef-e5242298549d","resolution":{"observed_at":"2026-05-21T03:53:56.416157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini: Try deep research and gemini 2.0 flash experimental","venue":null,"work_id":"8bf15845-c2cd-40a7-8c99-0aa3f744388d","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:2afae99ace1f12ab8e84dc1cc6e2d2fb51d06e07c88f4cae19dd31525db5a617","observation_id":"92f1e3f9-aac7-4c2a-9c8a-3f1de76b59d8","resolution":{"observed_at":"2026-05-21T03:53:56.406600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind2web 2: Evaluating agentic search with agent-as-a-judge","venue":null,"work_id":"10c3cd1d-f982-42ac-a55e-1497df0c45c7","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:49e9d173f429d0dbc2c05bb70fa09fb553887b60f400435e6a768cb9031fcc47","observation_id":"147496c8-dc87-4bd1-8a95-968530998e69","resolution":{"observed_at":"2026-05-21T03:53:56.454001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepsearchqa: Bridging the comprehensiveness gap for deep research agents","venue":null,"work_id":"55e39fec-4749-45d4-9599-6252535f0ede","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:40fb091bf3a7c60a99d8c0750ecf96d3c6ec80bc9ea949215ed51beefe3de9cc","observation_id":"c8df9601-a81a-4459-984d-c69f29790b47","resolution":{"observed_at":"2026-05-21T03:53:56.417383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"890e0431-6ffc-4dbb-a7f5-ad0d1758b0e3","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:729248a404b87891eb7cddc18670fe2729cd9da1b106745898e111bbdf26308d","observation_id":"20798bb5-f860-4828-9f54-095b530351a0","resolution":{"observed_at":"2026-05-21T03:53:56.427354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:12:55.019758Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R","venue":null,"work_id":"15ef65b6-a173-475b-9a2f-4554e2e14117","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:ebff5e1987feca26806b011c7184e8bb7d0831ca12154e307e7b3976570ef617","observation_id":"828645ed-e8b2-4a2d-82f6-bd70d1b7d385","resolution":{"observed_at":"2026-05-21T03:53:56.459621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e3bf665b-c63b-4825-81d5-de9ce1224779","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:776001a019cd73a32ba6b4c94d02717b49cb3ec4817059a696c982c3582746eb","observation_id":"b2b409fd-50b8-4c6c-8e54-24d3b2fa151d","resolution":{"observed_at":"2026-05-21T03:53:56.450143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08536","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:14.720287Z","title":"Deepresearch bench ii: Diagnosing deep research agents via rubrics from expert report","venue":null,"work_id":"28611890-2c8c-4a88-b267-a41635ef7b35","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:e0953ef8bc91bbc2b5678e22a5dd0712d29d7fcfec17a134806d981ff3e8d9f6","observation_id":"65e3481e-39b0-4f39-97e3-a52e4ba65592","resolution":{"observed_at":"2026-05-21T03:53:56.141482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":"8d047774-7e68-4013-908e-2a33d81dc88a","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:b2d8332eecfdbb8be86f420b5b1e82efb3939f47d041d910b5491b963ae64a50","observation_id":"1f7ac2ef-ae68-4dfa-baf9-464e87e8a031","resolution":{"observed_at":"2026-05-21T03:53:56.437142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autobencher: Towards declarative benchmark construction","venue":null,"work_id":"333fa266-b7f8-4fe2-90e9-b5b9019b803d","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:ac9eddae085a38198d52b83fbde6dd8c4bde237a1b39a4eeeaf6551c326ff843","observation_id":"a45f4968-46d7-44f6-bd8e-5506a9e35c06","resolution":{"observed_at":"2026-05-21T03:53:56.455927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenResearcher: A fully open pipeline for long-horizon deep research trajectory synthesis","venue":null,"work_id":"ff2371a9-5b84-48dc-9a3d-9386302dc961","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:bd9d02a84b2593cb2380481a2425c23d923609983a5c8e6bc7841544280302cf","observation_id":"9c1ae438-edd2-43e7-8ce0-c2bfe2dabcdc","resolution":{"observed_at":"2026-05-21T03:53:56.442535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wildbench: Benchmarking llms with challenging tasks from real users in the wild","venue":null,"work_id":"3aae5475-ca89-4ba3-9b80-a1af78d98ded","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:5c1a0e426e8fd45a3764657d07b36b2d64929f0a5d66892309da5d85b865b4fe","observation_id":"8934e999-baf1-482c-b75a-0629bb9e0c59","resolution":{"observed_at":"2026-05-21T03:53:56.446406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":"b2a80204-1da9-4e72-b8f1-22eacae4e8dc","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:ea7bf1992c512a9570d9df9903df405368d9047a4a5e3d4c69eb04525ac46ca0","observation_id":"56e5febc-3589-4d28-92a4-8333531869d0","resolution":{"observed_at":"2026-05-21T03:53:56.434835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities","venue":null,"work_id":"8b2aa8bc-02fb-49e9-a908-0ef1b89bd64b","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:d93bbbe1ed64e71695c33f80c6d289aafe2d5c59bcdf1f938ef149d9feeb7e61","observation_id":"d12d6ada-ccfd-4e64-95b5-2e66cc1cc34b","resolution":{"observed_at":"2026-05-21T03:53:56.436884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merrill, Alexander G","venue":null,"work_id":"39587f70-cbf2-4359-8158-e27f27799248","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:035ef923a2f7dba9bafec9b7a2918be45bfa35008f09f88522688fb173dff3fb","observation_id":"6120caf4-1536-478a-b777-aa91894387ef","resolution":{"observed_at":"2026-05-21T03:53:56.440962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaia: a benchmark for general AI assistants","venue":null,"work_id":"b32194d2-760a-4a08-aef0-505f758e81db","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:0ab4ca22f31e568922465eb3ef67c1fab0dfb9c16e72179b4b21542a50247839","observation_id":"b12c4eda-344e-4bda-b190-1cb4f45d9555","resolution":{"observed_at":"2026-05-21T03:53:56.448306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minimax m2.7","venue":null,"work_id":"feb15319-e446-479e-a74b-378e1b5af11b","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:5fa330b6a332076a7f9832660d5a01adbe002b4dd4e93e3cc7e18f2e1fbda6d1","observation_id":"4d736b59-de32-41ec-aac2-93dd1ae41dfe","resolution":{"observed_at":"2026-05-21T03:53:56.419353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kimi researcher","venue":null,"work_id":"9d9c4ec5-8b36-40a2-93f4-09660b9c3b11","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:fffea0093febcd640a3327f1eba621a2b45ac87932821c26b48c4e58666b0f9d","observation_id":"b3589db2-d955-45d5-940b-811b7ee55429","resolution":{"observed_at":"2026-05-21T03:53:56.431198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kimi k2.6","venue":null,"work_id":"5edc39b3-f44e-4459-a601-d8e7ab322fef","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:b92b53cc71bad3a0c1099e85f98ee2b69870414e202755004e18b76b1a79444f","observation_id":"26be7107-094c-495c-8b5e-96e9db3e7cca","resolution":{"observed_at":"2026-05-21T03:53:56.407701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Codex cli","venue":null,"work_id":"aad880cc-8e1e-496c-9146-3c1631a134b0","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:acf8bd665b9109ca3c7895f43d86ebb26149c3b9a6e2ce9790758c5311cdf980","observation_id":"9acb3002-0399-4b6b-8cd0-ff7465ebd26f","resolution":{"observed_at":"2026-05-21T03:53:56.421458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing deep research","venue":null,"work_id":"aceefb4d-52d3-4b4c-88ff-e89a15ecb643","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:c8e43e5bb2d6cabb8391500298f425f88a4639ed54577f608c8d82e8972d0a62","observation_id":"0da1ca6d-d296-4b3b-a3b4-dc3ab7918eaa","resolution":{"observed_at":"2026-05-21T03:53:56.423552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gpt-5.5","venue":null,"work_id":"8ff1ff85-3457-4c35-968e-122a148ae215","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:23210fcacdfd27180795ca483e2e5b77e0a65a110a08f8137c3399d0c5491b80","observation_id":"70f26a93-73e3-4e07-bfd7-ba7470e94889","resolution":{"observed_at":"2026-05-21T03:53:56.425344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez","venue":null,"work_id":"224ec017-39c5-4c73-8ed0-40daed8f057d","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:06df548629a2da44c3a6f67f571ce03103a43dad32500b57d244d41b63069892","observation_id":"a3ed035e-4ef7-4a07-937b-c215848c795e","resolution":{"observed_at":"2026-05-21T03:53:56.432921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing perplexity deep research","venue":null,"work_id":"e33116d3-8114-40e6-9335-ba531178ab03","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:911ddf51e2b36965324706359436d5c4a9e4f402d94c92c0cd53629118fda0ee","observation_id":"2d499299-ea30-4fb7-be71-64c001a0ade7","resolution":{"observed_at":"2026-05-21T03:53:56.457732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3.6-plus: Towards real world agents","venue":null,"work_id":"7277a668-0f9e-43f3-8821-834765deef90","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:d20b6a22c10942da3243066e13600f00f05f5528defd1d7ad2dec51a6c80b9ac","observation_id":"e4dddd28-573b-491d-8c3d-f36c5fdb2993","resolution":{"observed_at":"2026-05-21T03:53:56.413220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:43:39.491142Z","title":null,"venue":null,"work_id":"20816d24-89c4-490b-99ef-c4c53d0419e5","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:abed55007474778f8b9d3588f63b1c9c2493ffa2b35146e6f6253c8fa98e88a7","observation_id":"43fc4930-b197-4278-be47-26892d5361f5","resolution":{"observed_at":"2026-05-21T03:53:56.409495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Appworld: A controllable world of apps and people for benchmarking interactive coding agents","venue":null,"work_id":"651d0933-a2ff-4e49-9bc7-7f669edf6cd7","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:ad7ad501d9f8b77e99c7640cdcc1002338be07ee973361d3b7ec42e4d806df66","observation_id":"3bc9f27b-605a-4464-948c-49276397095d","resolution":{"observed_at":"2026-05-21T03:53:56.411378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liveresearchbench: A live benchmark for user-centric deep research in the wild","venue":null,"work_id":"3d7d6775-dc53-4957-aac8-5e635d2eebfc","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:7bc5f0c403cd651e234ad8c0fc1de8987faa5143e1b1e56e43150188578088db","observation_id":"3397a8ab-7e37-4a6f-b490-21135dd7fe53","resolution":{"observed_at":"2026-05-21T03:53:56.415305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, Hoang H","venue":null,"work_id":"b5a3a41d-9d60-4faf-b11a-be55f69e3856","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:092add73f82d1467b404b5ce1c2bfb1445856101c150bd02aa3eb485f0605f1b","observation_id":"fe0b2868-c3c4-4547-af16-de074edc98a7","resolution":{"observed_at":"2026-05-21T03:53:56.429360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":"e2a11497-7534-474f-9f0a-6251f8106d12","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:1f7dd1f598c446294f26b9c67e590151bc9f041403d9fbd29e4308536e1916c7","observation_id":"56e70b88-a114-4d1d-8150-843d8785974d","resolution":{"observed_at":"2026-05-21T03:53:56.451957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Browsecomp: A simple yet challenging benchmark for browsing agents","venue":null,"work_id":"82919e18-a040-4d0b-a0df-a8f48349c05b","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:4d4b993e1af6cce9f7f934f9ea1fe71a7f536acf0ec0ae2cc9be0cd4fe148d24","observation_id":"e015db3d-5889-496e-b574-98cef9c9be4a","resolution":{"observed_at":"2026-05-21T03:53:56.399933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Widesearch: Benchmarking agentic broad info-seeking","venue":null,"work_id":"eb1d2998-d9d9-4095-a1cd-d9c918c06b72","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:847368e966004b164efcc3318c7006938a8e093b059c03f43c17ed2e292aec70","observation_id":"035b040a-d83c-4abb-a803-18f7dbbea62c","resolution":{"observed_at":"2026-05-21T03:53:56.412272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Webwalker: Benchmarking LLMs in web traversal","venue":null,"work_id":"551bb8cb-e1fa-4436-b26b-67d1b39becc5","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:1f65967154283a4783535f09b18d380bc36477bd6e3efd61030b3a1f21f66f64","observation_id":"15e2472e-144a-4b12-8e54-7f5c7f0c1534","resolution":{"observed_at":"2026-05-21T03:53:56.398046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepResearch-9K: A challenging benchmark dataset of deep-research agent","venue":null,"work_id":"7865255c-a839-486e-bed5-ca42502df8b7","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:b4318ca9986a43c7cf12d79ee16d02097c5eb077264be50ef6fab057aeaa9c23","observation_id":"c6a035e8-4361-43ca-bbb3-df176fb989b7","resolution":{"observed_at":"2026-05-21T03:53:56.403727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":"f306120c-79ef-4c3e-a45a-99cda3ed398f","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:a563df4303b2771cd66cc6e45c9c4fc52e98d1a3177294f730d557e43cb10f41","observation_id":"118d18be-0b79-4525-b9cc-7ef12e96ef35","resolution":{"observed_at":"2026-05-21T03:53:56.446572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:12:54.904898Z","title":"SWE-agent: Agent-computer interfaces enable automated soft- ware engineering","venue":null,"work_id":"74ced3fc-504e-4314-9303-e05f30382daf","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:f40e51164d2e4669207db5128018f2deab7d5b56a8d17e86c9ca5f3a8e42d1ef","observation_id":"be86de82-130d-4070-a7d5-de295fb40369","resolution":{"observed_at":"2026-05-21T03:53:56.399045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"τ-bench: A benchmark for tool-agent-user interaction in real-world domains","venue":null,"work_id":"10d14525-ab42-4909-a927-51a1f28e0896","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:a666815c42cf30e134b5e455a7e09b616adfdc9a73a6adf8f26ac83983f938ec","observation_id":"d905eb25-cb62-4624-99a4-65e1ce93f0bf","resolution":{"observed_at":"2026-05-21T03:53:56.395426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AutoResearchBench: Benchmarking AI agents on complex scientific literature discovery","venue":null,"work_id":"7a173f39-c02e-4e58-9ab9-e3cf77397bb0","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:d92386c3979fed90c371fcbac994b772252f1cfa7bf0c92ff0a24315868f40c0","observation_id":"97cabf09-9267-4b5a-98bb-3a7d7a49f95f","resolution":{"observed_at":"2026-05-21T03:53:56.423743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval augmented fact verification by synthesizing contrastive arguments","venue":null,"work_id":"f16e6de8-7323-42ba-9429-5925ef72987f","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:61ad866ea72bf6f2f2efc4e1f2e96c165ebcca36ba3c50100e014eccb45ac600","observation_id":"69f13707-dfc0-452a-837a-15f3bbcf0477","resolution":{"observed_at":"2026-05-21T03:53:56.385859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GLM-5.1 overview","venue":null,"work_id":"9ab49556-1708-430d-9007-8f3b2d14ddd4","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:a9dce476743dd70200602f827339e614934ae38fdd335d7bd12a3dd947f03432","observation_id":"594e2a7c-7270-4d34-893b-651f00781ae1","resolution":{"observed_at":"2026-05-21T03:53:56.390008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking data science agents","venue":null,"work_id":"774633aa-9f40-4dfc-ad95-6f58b09e29fb","year":2024},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:eaf64c4a0efb91e85d18b9513bde80c9fc9712a7b825335719b4e378df59f7b1","observation_id":"57422f94-a145-42ae-ae46-51a4473a0e97","resolution":{"observed_at":"2026-05-21T03:53:56.396110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"b950affc-2517-46a3-b169-678d73615b20","year":2023},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:32ee1c5eb25e09359f99941616ca35e76fd1bb9d7927fdadb1db31ff5a2a76d8","observation_id":"253cecdc-7bcb-4b7f-8dc9-352fd66fa5e4","resolution":{"observed_at":"2026-05-21T03:53:56.401739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Draco: a cross-domain benchmark for deep research accuracy, completeness, and objectivity","venue":null,"work_id":"31c7e441-dce9-450b-878b-d5bfc231dee9","year":2026},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:8865f720d1ea2bc176d937e8785ef806c3b21967b43b9f1ec555ff4c3ef1f958","observation_id":"b5c25d08-11e9-4a08-b802-5fefb8657d4a","resolution":{"observed_at":"2026-05-21T03:53:56.391499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Browsecomp-zh: Benchmarking web browsing ability of large language models in chinese","venue":null,"work_id":"880acb2c-98cc-4817-acca-40d4d657d31e","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:d83280262aad98d63db48c7fe0fcdaf1ce72cc0b5bf777d45f81cd25c5bd82b4","observation_id":"f309b051-1586-400e-a92a-27d16328c8d4","resolution":{"observed_at":"2026-05-21T03:53:56.393459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"not available","venue":null,"work_id":"77a27ed5-64f3-4127-8de5-ed069987d13f","year":2025},"citing_paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T03:53:41.053206Z"},"links":{"citing_paper":"/paper/2605.21482"},"observation_digest":"sha256:38af1a2dc5053e07196d213a145d3a4babd18d27b19514106ff7abfa2ed48fd5","observation_id":"f82cb579-efe2-4f35-810e-d7472b99ae53","resolution":{"observed_at":"2026-05-21T03:53:56.400730Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21482","last_updated":"2026-05-20T17:59:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T00:54:39.186540Z","submitted_at":"2026-05-20T17:59:03Z","title":"DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":3,"verified_fuzzy":50},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2605.21482."}