{"as_of":"2026-08-10T19:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05f5a7b6069108dc66ca1f91914ed9ac64fd3dccd899ade1f09a02052e5a6996","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:31:25.434024Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02163/citation-record","integrity":"/paper/2608.02163/integrity","json":"/paper/2608.02163/citation-record.json","paper":"/paper/2608.02163"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:19.520216Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:19.520216Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:efdf0f2a70741230b7d84d687807723c0c59d56cf15025ea879d80d560db530a","observation_id":"d876f57b-0db6-4ee5-a3fa-a6f194419450","resolution":{"observed_at":"2026-08-04T13:31:19.520216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:19.668177Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:19.668177Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:9536da749c1d0386983268dfbbc65c69e11206ad117f4d5d0518c52532e4fba1","observation_id":"c653a51e-0eac-4a12-8ddb-bcc86ee744d5","resolution":{"observed_at":"2026-08-04T13:31:19.668177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:19.790732Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:19.790732Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:66ffb0e652af275d389c2b196b8442452e04d5db8c51744aa277ef4642fcfc3f","observation_id":"5795995a-d4af-44d5-a044-c8529f71166b","resolution":{"observed_at":"2026-08-04T13:31:19.790732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-07T14:15:18.269910Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-04T13:31:20.019109Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:20.019109Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:a20506b0abee40d96d157415999e7557404756fe40b4cdfccc6aa91ca0f59244","observation_id":"20ecf46c-6ba1-4f05-ba7a-d1ddf41e6faf","resolution":{"observed_at":"2026-08-04T13:31:20.019109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10504","last_updated":"2026-07-12T05:28:34Z","snapshot_observed_at":"2026-08-10T15:18:38.367838Z","submitted_at":"2026-01-15T15:28:21Z","title":"DR-Arena: an Automated Evaluation Framework for Deep Research Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10504","snapshot_observed_at":"2026-08-04T13:31:20.186537Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:20.186537Z"},"links":{"cited_paper":"/paper/2601.10504","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:103bfde437168fa00bb81b20afe5627768fd4256434e7a20da6a99bcf0ac45e0","observation_id":"69588a72-3f1f-429c-8cf6-a709a766c0d2","resolution":{"observed_at":"2026-08-04T13:31:20.186537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:20.301227Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:20.301227Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:52d53a35da52c6de4365032e1899fec20ed27094a21e08a479d17afcb6e82caf","observation_id":"3d517340-c335-47f7-b708-ae7a8d5c43ab","resolution":{"observed_at":"2026-08-04T13:31:20.301227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21506","last_updated":"2025-07-03T15:47:40Z","snapshot_observed_at":"2026-08-07T20:30:36.688999Z","submitted_at":"2025-06-26T17:32:50Z","title":"Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21506","snapshot_observed_at":"2026-08-04T13:31:20.447232Z","title":"J.; Shu, Y .; Song, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:20.447232Z"},"links":{"cited_paper":"/paper/2506.21506","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:ceb803858ae442578c82ac80599f03583497c547ab0e97879ae188de3679de92","observation_id":"90d1bb1f-213b-403c-a135-ed2d348e1ab8","resolution":{"observed_at":"2026-08-04T13:31:20.447232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.00986","last_updated":"2026-06-01T02:51:22Z","snapshot_observed_at":"2026-08-08T15:33:07.101861Z","submitted_at":"2025-11-30T17:16:47Z","title":"ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.00986","snapshot_observed_at":"2026-08-04T13:31:20.573132Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:20.573132Z"},"links":{"cited_paper":"/paper/2512.00986","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:7d9311f62d0f628a91fba6f3c0e5d3794b74d8c4651873810eb86ab5facd6f49","observation_id":"d823fe9a-e964-4b59-9b64-2b3c0d49e089","resolution":{"observed_at":"2026-08-04T13:31:20.573132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.17776","last_updated":"2026-07-13T06:52:44Z","snapshot_observed_at":"2026-08-03T15:15:19.176854Z","submitted_at":"2025-12-19T16:46:20Z","title":"DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.17776","snapshot_observed_at":"2026-08-04T13:31:20.730901Z","title":"H.; Song, H.; Choi, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:20.730901Z"},"links":{"cited_paper":"/paper/2512.17776","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:ac64ad1db40d03cb0f728fb315375f461c4d92ebdcf843664a588e04864d7cdc","observation_id":"b3421465-2ddc-4947-bc07-e77ecec5f516","resolution":{"observed_at":"2026-08-04T13:31:20.730901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:20.895862Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:20.895862Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:d3658029a9ad4ef72a92248002fc01ae68c92a927688972c66191618622dd071","observation_id":"e5b56f77-67b6-42c3-a0fb-e6acbc912f50","resolution":{"observed_at":"2026-08-04T13:31:20.895862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:21.047933Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.047933Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:55d78819668c79daf69ce44e6c507ff1faf7dd9871ace97fd1fc66f7b2cf58e0","observation_id":"868ad434-1db3-489f-8f1d-00934fad7bdd","resolution":{"observed_at":"2026-08-04T13:31:21.047933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-07T04:14:46.368431Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-04T13:31:21.166209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.166209Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:4e3164c1134a62c2a930b43b38ffb419123aa146dadf3ff916524f5dbc475405","observation_id":"69a34f5d-1739-45d7-8a99-af30964826e1","resolution":{"observed_at":"2026-08-04T13:31:21.166209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:21.278604Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.278604Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:9f07dd662cb0fd250f744915b979f4ec1497409b2c3a801b8b41f8f985218711","observation_id":"18eceae9-eeac-49b9-be23-dab7466f7860","resolution":{"observed_at":"2026-08-04T13:31:21.278604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07042","last_updated":"2026-05-07T23:45:07Z","snapshot_observed_at":"2026-07-06T23:19:25.538514Z","submitted_at":"2026-05-07T23:45:07Z","title":"The Context Gathering Decision Process: A POMDP Framework for Agentic Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07042","snapshot_observed_at":"2026-08-04T13:31:21.537058Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.537058Z"},"links":{"cited_paper":"/paper/2605.07042","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:2cd212d7855a8198dde1b5c890512dbd482af51936d2e00471de84c80b200be4","observation_id":"39226649-5485-4d43-a93d-97177dbd3d97","resolution":{"observed_at":"2026-08-04T13:31:21.537058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:21.683347Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.683347Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:24d33781d96929deca7780caf85ea2deb90db686a49f5fc1bb5b444a9acd2393","observation_id":"6d27df6d-a801-4e2f-b8d3-07fab81ab3d6","resolution":{"observed_at":"2026-08-04T13:31:21.683347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-09T01:03:55.193390Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-04T13:31:21.844426Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.844426Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:a31c41c48a5fb800c5d11307764bc5f47195c0ca36529d9d39b62718e93d2609","observation_id":"85d1e7e1-bc35-4ae4-9652-33ebf43fe193","resolution":{"observed_at":"2026-08-04T13:31:21.844426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15804","last_updated":"2025-08-14T03:33:43Z","snapshot_observed_at":"2026-08-05T20:33:08.722179Z","submitted_at":"2025-08-14T03:33:43Z","title":"ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15804","snapshot_observed_at":"2026-08-04T13:31:21.958519Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.958519Z"},"links":{"cited_paper":"/paper/2508.15804","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:03b4f311f5edf4a43450a96fbc56314f9badf40e09c0baaf4b90dd16b3462f78","observation_id":"ea6935a7-5399-4696-a958-6549381a1da9","resolution":{"observed_at":"2026-08-04T13:31:21.958519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:22.062687Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:22.062687Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:1a1e9f9718dd8fdd809c86835754357c3c4dc68dd5024ed03a349bbe7303327a","observation_id":"a2dd8668-49b7-46f8-be2d-eb9204c28960","resolution":{"observed_at":"2026-08-04T13:31:22.062687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-08-10T12:19:42.688166Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-04T13:31:22.167052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:22.167052Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:4e4005e8ff1672a68fd4fa56804d80afcfec37b178fdee68934f0acce7d3942b","observation_id":"ed668f5f-e285-46f8-83b7-0246a5d78ea3","resolution":{"observed_at":"2026-08-04T13:31:22.167052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14518","last_updated":"2026-04-17T01:58:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:20:06Z","title":"Mind DeepResearch Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14518","snapshot_observed_at":"2026-08-04T13:31:22.318765Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:22.318765Z"},"links":{"cited_paper":"/paper/2604.14518","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:84801cdfba2eda55792080726a9d6cc1d1269cb8ec5afd023834e46d3c7b2dfc","observation_id":"08a7faf5-d4c6-4995-80d6-28f532e9ab53","resolution":{"observed_at":"2026-08-04T13:31:22.318765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:22.482714Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:22.482714Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:0e314feefe07d7cc47a7b573a80da5a478c007e2d9072573c930ae5d24d0da38","observation_id":"228ea829-22d7-4ed9-adec-9104e3262f3c","resolution":{"observed_at":"2026-08-04T13:31:22.482714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:22.644303Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:22.644303Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:d88b66f8ffae07e4198408115270e5d28a26f41a880b424626b7114cd42b5927","observation_id":"86407943-c499-45da-af41-3a5b31ba21a3","resolution":{"observed_at":"2026-08-04T13:31:22.644303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T13:31:22.810367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:22.810367Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:016a3d8fb0d2918f4514b3e2191dcebc9835db0b30800f536b73db650b28c29c","observation_id":"75d091c6-98b3-4ad6-9220-c37490d4d51c","resolution":{"observed_at":"2026-08-04T13:31:22.810367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:22.973087Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:22.973087Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:0945c5604101d9eee1e969f1ff5a91df2d37772afe5ad2ba38a3488745d67ff6","observation_id":"14f0a6b5-0f10-440a-8029-bae92aa13718","resolution":{"observed_at":"2026-08-04T13:31:22.973087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:23.078824Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.078824Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:075c43006f6b7c02229b8e2e633c32ae262c8bc53a89554b8903a178302c334f","observation_id":"7d6a1d96-24ee-4ce4-9854-37d5a79fd847","resolution":{"observed_at":"2026-08-04T13:31:23.078824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:23.299229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.299229Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:c2bed2f08fc2ea7f876feb658210f27d9e18acab0d9c8b7a966526c46dbf2710","observation_id":"f862a1be-de59-49f8-abff-84b5c27b3d08","resolution":{"observed_at":"2026-08-04T13:31:23.299229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15061","last_updated":"2025-07-20T17:53:37Z","snapshot_observed_at":"2026-08-08T20:12:05.511553Z","submitted_at":"2025-07-20T17:53:37Z","title":"WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15061","snapshot_observed_at":"2026-08-04T13:31:23.396921Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.396921Z"},"links":{"cited_paper":"/paper/2507.15061","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:ddbc701a223c53a970c531af777c37bbcc0690b07e2be6088b060b951605dc6e","observation_id":"ce18a2b8-13d3-44cc-8c85-76ad96a976fd","resolution":{"observed_at":"2026-08-04T13:31:23.396921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09992","last_updated":"2025-06-29T05:24:54Z","snapshot_observed_at":"2026-08-02T03:21:18.031853Z","submitted_at":"2024-04-15T17:59:50Z","title":"MMInA: Benchmarking Multihop Multimodal Internet Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09992","snapshot_observed_at":"2026-08-04T13:31:23.501241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.501241Z"},"links":{"cited_paper":"/paper/2404.09992","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:076b4f0e67303e1a4c004792c139ebe087db6ad193610807af1a9cc218832812","observation_id":"d6dc7860-028e-4706-a1ef-14668b547202","resolution":{"observed_at":"2026-08-04T13:31:23.501241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:23.533120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.533120Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:269143a7486df53a1f052347988aa6ca93944a364999b7a1c37bd7f758ce66f9","observation_id":"e42b6b81-a4f9-492d-8645-a95c8f0bb5fe","resolution":{"observed_at":"2026-08-04T13:31:23.533120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:23.551281Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.551281Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:73a2cfb033259b85c512317652ce773ec1366bafa3e7815b90cc774f5362512a","observation_id":"3a041ccb-4d57-4edf-9014-fdf8e74ae344","resolution":{"observed_at":"2026-08-04T13:31:23.551281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-04T13:31:23.695711Z","title":"W.; Passos, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.695711Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:72f13367936978ea3bbdbf20e8706439aa95e18bcd34970f5ed7769bf818e29a","observation_id":"1cb79da5-9126-435e-aea3-0b58b98fc26a","resolution":{"observed_at":"2026-08-04T13:31:23.695711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:23.834443Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.834443Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:6c8b408ee7e0b500d09da0b0dd73c274235b5fefee7024981f99c38cd6ef5361","observation_id":"6a249b6f-9f25-48db-9885-d09fc931f137","resolution":{"observed_at":"2026-08-04T13:31:23.834443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-07T13:00:07.473210Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22648","snapshot_observed_at":"2026-08-04T13:31:24.114972Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.114972Z"},"links":{"cited_paper":"/paper/2505.22648","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:8d639e5cd2e975c45d22b30e39fc11030eca93bfca5f34fcfb53345c19271f2f","observation_id":"10978142-90b9-479d-b748-93a4baabba7c","resolution":{"observed_at":"2026-08-04T13:31:24.114972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07572","last_updated":"2025-08-10T05:59:20Z","snapshot_observed_at":"2026-08-09T20:43:41.220993Z","submitted_at":"2025-01-13T18:58:07Z","title":"WebWalker: Benchmarking LLMs in Web Traversal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07572","snapshot_observed_at":"2026-08-04T13:31:24.190907Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.190907Z"},"links":{"cited_paper":"/paper/2501.07572","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:3009abc44a60701375e3cf4a19b75b5577a4432c1332082410cccba534645834","observation_id":"7dc2973b-826c-4975-8efb-e55a894676be","resolution":{"observed_at":"2026-08-04T13:31:24.190907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07999","last_updated":"2025-08-28T09:31:57Z","snapshot_observed_at":"2026-08-06T15:15:48.072084Z","submitted_at":"2025-08-11T14:03:09Z","title":"WideSearch: Benchmarking Agentic Broad Info-Seeking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07999","snapshot_observed_at":"2026-08-04T13:31:23.950379Z","title":"arXiv:2508.07999","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.950379Z"},"links":{"cited_paper":"/paper/2508.07999","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:49000a40ee696eab3554a07d79ef54b7c2fa0ff87c62413d3e94078cb13ef1d2","observation_id":"146d25f6-e2ab-48bc-9508-23853d6d65e0","resolution":{"observed_at":"2026-08-04T13:31:23.950379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24218","last_updated":"2026-05-22T20:59:20Z","snapshot_observed_at":"2026-08-03T14:35:57.280065Z","submitted_at":"2026-05-22T20:59:20Z","title":"QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.24218","snapshot_observed_at":"2026-08-04T13:31:24.395409Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.395409Z"},"links":{"cited_paper":"/paper/2605.24218","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:70197bf5e26e772e3bfef587ca07648c30e343c48f548412f8b8f84a85d654a9","observation_id":"3e5d73b5-2bdd-4263-ac31-5c86bfa18cb8","resolution":{"observed_at":"2026-08-04T13:31:24.395409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-07T11:53:13.790399Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12594","snapshot_observed_at":"2026-08-04T13:31:24.476270Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.476270Z"},"links":{"cited_paper":"/paper/2506.12594","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:6d288490262b52af96435dca9b166f50c86d87fcc11f5d54532d3195373f76d5","observation_id":"71f710dd-432b-4b3c-8ad1-41b73802f128","resolution":{"observed_at":"2026-08-04T13:31:24.476270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-08T15:14:07.565399Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01152","snapshot_observed_at":"2026-08-04T13:31:24.303475Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.303475Z"},"links":{"cited_paper":"/paper/2603.01152","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:e05fd0ceae7ae2856c8d8702d7548181cad0983e9384288e477ae44bfc01dc41","observation_id":"e84c7fd4-68bc-482a-9909-2e0e918727ec","resolution":{"observed_at":"2026-08-04T13:31:24.303475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:24.687214Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.687214Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:a1cd04a7ea975617430139fdc0640660f537016712dd2a30e096d5bd45555b0a","observation_id":"c8820484-d1d7-4c49-a149-82e8ec45785f","resolution":{"observed_at":"2026-08-04T13:31:24.687214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-04T13:31:24.753889Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.753889Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:2c34e429eb9a8a21ff8f1d4c7df6c547a0cd189f7900cb308a1f43f28adcb25f","observation_id":"27ca895f-cc55-44a1-8c62-003964f5102b","resolution":{"observed_at":"2026-08-04T13:31:24.753889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02506","last_updated":"2025-05-20T14:15:36Z","snapshot_observed_at":"2026-08-06T10:56:02.119546Z","submitted_at":"2025-01-05T11:06:55Z","title":"ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02506","snapshot_observed_at":"2026-08-04T13:31:24.580312Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.580312Z"},"links":{"cited_paper":"/paper/2501.02506","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:d7f8d8651c2eeeb16c0931a9b1e884976502c953ec2db6864ac396f3a4654616","observation_id":"6a6f8bb9-a148-4060-95ac-01df7e005d38","resolution":{"observed_at":"2026-08-04T13:31:24.580312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-04T13:31:24.852082Z","title":"latest / current / recent","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.852082Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:25791c5ad6c85a2819734a217b3d1b401055e622df45c82b732fe677585f1507","observation_id":"99ccb08b-8049-4a12-a38a-945793c37e3c","resolution":{"observed_at":"2026-08-04T13:31:24.852082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:24.944142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.944142Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:01bd2888814516de991284bd418641b6873a62a317c3a7494927a27e380f82e5","observation_id":"bf6f3598-9235-4098-afcc-8f80ef8aef2b","resolution":{"observed_at":"2026-08-04T13:31:24.944142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:25.024258Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:25.024258Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:854bb70942bf4b1d606fdb9a7e3074477fe2ea6cd6daa5df541d289aa52f5571","observation_id":"43ff2b74-39ab-4ba1-96e3-914810e734d6","resolution":{"observed_at":"2026-08-04T13:31:25.024258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:25.086753Z","title":"levels‘ / ‘including‘ / ‘considering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:25.086753Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:8085d9f25e893425e03c761bf54d8125ab9af1f3d9db8c065e602fcb407d705e","observation_id":"de301102-ba98-4deb-b1ba-4c503397c611","resolution":{"observed_at":"2026-08-04T13:31:25.086753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:25.153640Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:25.153640Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:7b626059aac9a7e1c439b31803ed53e75758ea868b5d94fa03b733a46fc3d12d","observation_id":"148a8d68-a8e8-40d6-816a-61252c2a25d1","resolution":{"observed_at":"2026-08-04T13:31:25.153640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:25.227641Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:25.227641Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:56b1a5c9977058fd35df0532d9e47a31d0ba9936bb5b39b8073cf9c4dc63d1b0","observation_id":"527ec13a-381d-413a-a07a-963e0c4e3092","resolution":{"observed_at":"2026-08-04T13:31:25.227641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:25.300498Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:25.300498Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:36f508f8cb022f5427f8214727eb6a2a65cb39a152d873b79fdcd4f9ce75f4f6","observation_id":"086a015d-94ef-4b9d-8c5e-923c82ab874d","resolution":{"observed_at":"2026-08-04T13:31:25.300498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:25.343565Z","title":"first A then B","venue":null,"work_id":null,"year":1934},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:25.343565Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:dad311d7dd775ffe07eb33dc2a6081f185000618e73133d3da49a5c6791dd8b8","observation_id":"b9962a33-15fd-4248-90eb-e91a3689a637","resolution":{"observed_at":"2026-08-04T13:31:25.343565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:25.434024Z","title":"0.09 E Verify completion of state ratifi- cation (1) States that the three-fourths threshold was reached on July 1, 1971","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":1971,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:25.434024Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:d1e43c663b939275ec7613c242c8d7d820c929cd14dd84affe7c3113485c4eba","observation_id":"0a9d147b-56af-42fa-b79b-6a08b9371209","resolution":{"observed_at":"2026-08-04T13:31:25.434024Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:31:23.182978Z","title":"arXiv:2511.07685","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:23.182978Z"},"links":{"citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:7192f37578a146f1e82ceb000c58ccbd014ef1341fc08c3ed9c29433f6f8326e","observation_id":"5bc4d3d0-76f4-4c6e-a32b-65de1d817b03","resolution":{"observed_at":"2026-08-04T13:31:23.182978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11732","last_updated":"2026-06-04T05:47:57Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:14:15Z","title":"AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11732","snapshot_observed_at":"2026-08-04T13:31:21.412836Z","title":"arXiv:2605.11732","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.412836Z"},"links":{"cited_paper":"/paper/2605.11732","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:be66e11bb5ffd7ce474555dd87134439c79b18ba5f290c568216611eb5fd5a2d","observation_id":"2b21715b-254a-4ed4-8cee-60c9d7a91119","resolution":{"observed_at":"2026-08-04T13:31:21.412836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.02163."}