{"as_of":"2026-08-18T06:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7073d4ee7a0f14257d3d0a98c9b791f0414ba1df2d2313ffbedf32626ee19cc5","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:56:06.963501Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:55:37.784908Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-04T23:55:37.784908Z","title":"Characterizing deep research: A benchmark and formal definition.arXiv preprint arXiv:2508.04183, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-16T22:44:39.259309Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:37.784908Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:ec7452ec0ba643e8e2edc45e9e2599b006b6b4436d69e2f96793355decbc6218","observation_id":"4dacb85f-9cdc-4029-913b-85458931071d","resolution":{"observed_at":"2026-08-04T23:55:37.784908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-03T15:15:21.070914Z","title":"Engineer- ing standard for verifying data reliability and system per- formance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.17776","last_updated":"2026-07-13T06:52:44Z","snapshot_observed_at":"2026-08-14T06:01:54.475545Z","submitted_at":"2025-12-19T16:46:20Z","title":"DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation","version":5},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T15:15:21.070914Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2512.17776"},"observation_digest":"sha256:2285a405a170586e00539cb019f1cca9eeff302dece21923653a5aa0ddf3dcad","observation_id":"501f1ced-25ef-438c-9d5e-50fc2476867b","resolution":{"observed_at":"2026-08-03T15:15:21.070914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":"2508.04183","doi":"10.48550/arxiv.2508.04183","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Characterizing deep research: A benchmark and formal definition.arXiv preprint arXiv:2508.04183,","venue":"arXiv (Cornell University)","work_id":"646e6cd4-666a-4e9b-af4a-654ee70085d0","year":2025},"citing_paper":{"arxiv_id":"2605.00505","last_updated":"2026-05-17T17:18:53Z","snapshot_observed_at":"2026-08-15T16:37:00.677209Z","submitted_at":"2026-05-01T08:30:52Z","title":"LLM-Oriented Information Retrieval: A Denoising-First Perspective","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-09T18:54:06.144968Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2605.00505"},"observation_digest":"sha256:d04560ade8c419e2c081d625f776757eee37030f73636e521a80f2acb87d8f4b","observation_id":"11b1b2bd-db4d-48d4-b763-f577d1a0f2b7","resolution":{"observed_at":"2026-05-11T16:01:19.781040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":"2508.04183","doi":"10.48550/arxiv.2508.04183","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Characterizing deep research: A benchmark and formal definition.arXiv preprint arXiv:2508.04183,","venue":"arXiv (Cornell University)","work_id":"646e6cd4-666a-4e9b-af4a-654ee70085d0","year":2025},"citing_paper":{"arxiv_id":"2605.00505","last_updated":"2026-05-17T17:18:53Z","snapshot_observed_at":"2026-08-15T16:37:00.677209Z","submitted_at":"2026-05-01T08:30:52Z","title":"LLM-Oriented Information Retrieval: A Denoising-First Perspective","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T00:18:32.423103Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2605.00505"},"observation_digest":"sha256:0f8d83ac13360778ebd1b9d61563b586ca4e615107c42965c6f3787dcdfcb969","observation_id":"5925a9e2-9178-46d4-944b-42d66103eaff","resolution":{"observed_at":"2026-05-21T00:19:16.463224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":"2508.04183","doi":"10.48550/arxiv.2508.04183","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Characterizing deep research: A benchmark and formal definition.arXiv preprint arXiv:2508.04183,","venue":"arXiv (Cornell University)","work_id":"646e6cd4-666a-4e9b-af4a-654ee70085d0","year":2025},"citing_paper":{"arxiv_id":"2606.10460","last_updated":"2026-06-09T06:15:36Z","snapshot_observed_at":"2026-08-13T15:00:10.042585Z","submitted_at":"2026-06-09T06:15:36Z","title":"LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T13:41:35.986601Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2606.10460"},"observation_digest":"sha256:422cdf799ecc9b19fe39654ed81fe8e3ccd927ce351682d203ea2394094b4cfd","observation_id":"3a906274-6149-4fd3-8cf5-f1915fb0cf04","resolution":{"observed_at":"2026-07-03T04:47:37.840871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":"2508.04183","doi":"10.48550/arxiv.2508.04183","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Characterizing deep research: A benchmark and formal definition.arXiv preprint arXiv:2508.04183,","venue":"arXiv (Cornell University)","work_id":"646e6cd4-666a-4e9b-af4a-654ee70085d0","year":2025},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:5c7a279952b6f3437c386cd91305915adf954e316e5f9a29e60e96cfbba68dee","observation_id":"25802b62-2a13-4874-9fc4-744c6dedfc42","resolution":{"observed_at":"2026-06-27T09:50:48.500298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04183","snapshot_observed_at":"2026-08-04T13:31:21.166209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-09T10:48:32.320099Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:21.166209Z"},"links":{"cited_paper":"/paper/2508.04183","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:d54d51eea5cb5e3f1c148658fe73bb5713597e6319187e45524e49fe9813b632","observation_id":"69a34f5d-1739-45d7-8a99-af30964826e1","resolution":{"observed_at":"2026-08-04T13:31:21.166209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.04183/citation-record","integrity":"/paper/2508.04183/integrity","json":"/paper/2508.04183/citation-record.json","paper":"/paper/2508.04183"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14199","last_updated":"2024-11-21T15:07:42Z","snapshot_observed_at":"2026-08-15T22:46:04.473064Z","submitted_at":"2024-11-21T15:07:42Z","title":"OpenScholar: Synthesizing Scientific Literature with Retrieval-augmented LMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14199","snapshot_observed_at":"2026-08-06T00:56:02.786323Z","title":"Openscholar: Synthesizing scientific literature with retrieval-augmented lms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:02.786323Z"},"links":{"cited_paper":"/paper/2411.14199","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:f77f3907538879aba03abe32ed164aeaf45b96f38ef2361a9b3f3e5c034339a3","observation_id":"03dbcef6-8ba6-4ea8-a1b2-6cc82d8934e8","resolution":{"observed_at":"2026-08-06T00:56:02.786323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:11.504036Z","title":"Deerflow: Deep exploration and efficient research flow","venue":null,"work_id":"f5bc79ba-9948-402c-b196-b2248ebaa59f","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:02.847850Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:0c7a1ba709f0171a9b04d9844f19f232b3815fd6b8c8951523e04c119e7f4281","observation_id":"cb5ba02a-ce37-453c-b41d-06d2be453c67","resolution":{"observed_at":"2026-08-06T00:56:11.557746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.05495","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:08.059483Z","title":"Deep research comparator: A platform for fine-grained human annotations of deep research agents","venue":null,"work_id":"934db97b-99a2-4310-b264-18c8a5906af1","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:02.921609Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:5cc21aa2aa2704615d1911d89f9d0b82bc51a5d4468552dec6f2056bd905b5d5","observation_id":"7873f638-d91f-47cd-88a0-e42195d7d263","resolution":{"observed_at":"2026-08-06T00:56:08.115139Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:11.404454Z","title":"Patent claims revisited","venue":null,"work_id":"0c806e55-e663-4020-9686-d3a03bbb1d9b","year":2012},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.018397Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:eb76c33ccae84177fa9dcaf520d9b0ee1433e9aee4a2bcc614506bc34a7a3282","observation_id":"a3e13a14-e5ce-4011-adbb-3f79e81848f2","resolution":{"observed_at":"2026-08-06T00:56:11.446452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:03.130786Z","title":"Deepresearchgym: A free, transparent, and reproducible evaluation sandbox for deep research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.130786Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:169f3f0645bb7c1a2838f0637d21262f2053e6573488fa4b45551d1a3e0ae6dd","observation_id":"47392b29-37d1-4e98-92bf-f97b26228752","resolution":{"observed_at":"2026-08-06T00:56:03.130786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:11.202653Z","title":"Curie: Evaluating llms on multitask scientific long-context understanding and reasoning","venue":null,"work_id":"0e191b90-97b8-4042-81eb-097ac6a28527","year":null},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.227291Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:3c13d0a0c0e4ce3fa5f154f4592a01828c3f25cdc34c41252259ca0c045a8223","observation_id":"99c6a37d-7d75-4220-bc87-3016c71eba3a","resolution":{"observed_at":"2026-08-06T00:56:11.294644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14317","last_updated":"2025-02-11T14:51:08Z","snapshot_observed_at":"2026-08-17T14:07:15.618984Z","submitted_at":"2024-08-26T14:45:03Z","title":"Claim Verification in the Age of Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14317","snapshot_observed_at":"2026-08-06T00:56:03.359094Z","title":"Claim verification in the age of large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.359094Z"},"links":{"cited_paper":"/paper/2408.14317","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:a823502cd0d4e3d8c26fc981dd6befb40f03bedf8ee6a0626dc868b5f4ba6c57","observation_id":"4e0ec3d9-7757-42af-a5de-e943f08a60a0","resolution":{"observed_at":"2026-08-06T00:56:03.359094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-14T22:03:22.542485Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11763","snapshot_observed_at":"2026-08-06T00:56:03.435700Z","title":"Deepresearch bench: A comprehensive benchmark for deep research agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.435700Z"},"links":{"cited_paper":"/paper/2506.11763","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:39f5fad542476c3ea9c68b34308c9ed9cbe7c16dd06595c316e10f108aabc448","observation_id":"94b9e6c5-084f-4046-ab83-695e851dc49c","resolution":{"observed_at":"2026-08-06T00:56:03.435700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:11.049515Z","title":"Eli5: Long form question answering","venue":null,"work_id":"eb225664-f6c0-4fd0-9183-fe07af7ea94a","year":2019},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.500582Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:c65bd6c857e37145ca36696215cd5614c57d72ac97d7d01e945c8c60dd9c8c05","observation_id":"6575b478-1be1-47c9-a63a-a3d3dfef46e3","resolution":{"observed_at":"2026-08-06T00:56:11.105840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06287","last_updated":"2025-05-06T15:28:50Z","snapshot_observed_at":"2026-08-16T10:00:53.569641Z","submitted_at":"2025-05-06T15:28:50Z","title":"Deep Research Bench: Evaluating AI Web Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06287","snapshot_observed_at":"2026-08-06T00:56:03.602916Z","title":"Bosse, Jon Evans, Robert G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.602916Z"},"links":{"cited_paper":"/paper/2506.06287","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:784c148daf502668bf1fdad8d86e6a6b4de5b5aa6973ed4f5a145e5a0405cde1","observation_id":"9eb6e252-b576-4a9b-83d2-4dc6fe297981","resolution":{"observed_at":"2026-08-06T00:56:03.602916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10490","last_updated":"2024-08-20T02:19:35Z","snapshot_observed_at":"2026-08-16T13:25:21.387691Z","submitted_at":"2024-08-20T02:19:35Z","title":"Analysis of Plan-based Retrieval for Grounded Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10490","snapshot_observed_at":"2026-08-06T00:56:03.722051Z","title":"Analysis of plan-based retrieval for grounded text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.722051Z"},"links":{"cited_paper":"/paper/2408.10490","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:f152ecc56cbc448845ebee449ac022323990e7e517ebe914efaad51bfefc7e80","observation_id":"a22081e9-1dd1-4e54-bebd-feb46c640066","resolution":{"observed_at":"2026-08-06T00:56:03.722051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:10.880186Z","title":"We’re expanding our gemini 2.5 family of models","venue":null,"work_id":"d064f52d-decc-4a86-b814-527b35ee0334","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.837033Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:927c727e950f4f171acd813089a45265bd269e25073af27179ecf326fe220607","observation_id":"f49b4db0-90cb-4cff-a7fd-0ecf5d611baf","resolution":{"observed_at":"2026-08-06T00:56:10.959359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:10.707953Z","title":"Deep research is now available on gemini 2.5 pro experimental","venue":null,"work_id":"05ce5d14-ad2c-4a32-b7b3-bde2a38ed553","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.905777Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:8414862016f1a0f011e84846054a947c8fe98e46f726225fa396aeccf13d5c5c","observation_id":"d288c18b-dd7a-4337-b9cb-fc1ecd9a7fd9","resolution":{"observed_at":"2026-08-06T00:56:10.789187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.06589","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:07.693957Z","title":"Precise information control in long-form text generation","venue":null,"work_id":"3e59c2c0-88aa-4b69-b10e-85db068ba425","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:03.965981Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:44a5153604713aa99082008c8cdba665f853841a0e1aa35d79b70fb9424e868a","observation_id":"3e3e4e78-0a2f-435f-bf30-ad03d22bb8e4","resolution":{"observed_at":"2026-08-06T00:56:07.743079Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06268","last_updated":"2021-11-08T21:23:22Z","snapshot_observed_at":"2026-08-16T18:39:49.468256Z","submitted_at":"2021-03-10T18:59:34Z","title":"CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06268","snapshot_observed_at":"2026-08-06T00:56:04.028115Z","title":"Cuad: An expert-annotated nlp dataset for legal contract review","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.028115Z"},"links":{"cited_paper":"/paper/2103.06268","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:34b492dc9a7ff5cd2644b42df9dbbdab91dea429eed71d774ed994125bf53710","observation_id":"a4ba905c-3371-480d-bb91-b30b043d31c5","resolution":{"observed_at":"2026-08-06T00:56:04.028115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:10.528917Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":"00ccd2c4-453a-4711-86e8-27b06976b730","year":2020},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.126062Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:e3b2023d6fe7acad48074dac733ffbc9dc6c2c94353d978ee3ec7890f14ce391","observation_id":"4c1007f5-23ca-41f9-a99e-111c513a6e8d","resolution":{"observed_at":"2026-08-06T00:56:10.628438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:10.325708Z","title":"Bright: A realistic and challenging benchmark for reasoning-intensive retrieval","venue":null,"work_id":"ea0e2510-5660-4d74-9fcc-3fedb8544bf5","year":null},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.258755Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:5eb8a3010b36df77d9de59b65cbf4b0c8a4a457d00adcb8f7960c666478a8ae4","observation_id":"f1955f78-e90c-4975-b142-e196a5de0a86","resolution":{"observed_at":"2026-08-06T00:56:10.433449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-15T20:12:18.032530Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18096","snapshot_observed_at":"2026-08-06T00:56:04.340301Z","title":"Deep research agents: A systematic examination and roadmap, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.340301Z"},"links":{"cited_paper":"/paper/2506.18096","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:d57582a57578f95dede26953cca67336653ae6ce48df48984320519f831b4847","observation_id":"54aefd0c-7c46-42f1-ac90-1ae705b8b67d","resolution":{"observed_at":"2026-08-06T00:56:04.340301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:10.160394Z","title":"Open-source deepresearch – freeing our search agents","venue":null,"work_id":"ea5ad1b9-67ef-4749-b82b-15c9eb375c08","year":null},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.429658Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:6dbe6a7e720e859207977e692e0bdff28c3062327be25b781962cccca6f1c17b","observation_id":"ea2b89f0-64fc-452c-8df6-a23bb7b4239d","resolution":{"observed_at":"2026-08-06T00:56:10.204652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T00:56:04.494148Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.494148Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:b2f4d78e9c0eba204e73709c03d8b87f4a1ccc0d0d88fa6840067a4c2822838f","observation_id":"ab53b0c9-bfea-4277-bba3-a69948a65897","resolution":{"observed_at":"2026-08-06T00:56:04.494148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:10.009090Z","title":"Researcharena: Benchmarking llms' ability to collect and organize information as research agents","venue":null,"work_id":"8e3b6c4a-163c-47d6-bd10-601776465b04","year":2024},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.614465Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:2646f89820c64837437d6a5028caa8ca92ca64579111265c9f75fd6c8b3116b6","observation_id":"1b959b1b-33f0-4bf6-a975-0f8ce39e5abd","resolution":{"observed_at":"2026-08-06T00:56:10.063859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12941","last_updated":"2025-01-24T19:23:15Z","snapshot_observed_at":"2026-08-16T13:17:06.003567Z","submitted_at":"2024-09-19T17:52:07Z","title":"Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12941","snapshot_observed_at":"2026-08-06T00:56:04.705727Z","title":"Fact, fetch, and reason: A unified evaluation of retrieval-augmented generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.705727Z"},"links":{"cited_paper":"/paper/2409.12941","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:9a9f87a24f4a1d5071309f576a96aa16271cf75df6a71b51a066d46d17cfea22","observation_id":"1c0c6023-6e3a-42d0-8237-85a416344917","resolution":{"observed_at":"2026-08-06T00:56:04.705727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21776","snapshot_observed_at":"2026-08-06T00:56:04.807861Z","title":"Webthinker: Empowering large reasoning models with deep research capability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.807861Z"},"links":{"cited_paper":"/paper/2504.21776","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:c6262895412d41a95aa83d135107457a8cdc7d5a11e2682539f40b81cff0f361","observation_id":"e86d8368-f668-45c0-9d9e-86d5a7ff9b2e","resolution":{"observed_at":"2026-08-06T00:56:04.807861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:04.922012Z","title":"Lost in the middle: How language models use long contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:04.922012Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:40ec87ac32fa8f5cdab9555e76c521b77069b761317dacac53cfd4f7615ccc75","observation_id":"162653f0-454a-4c43-a31d-04e6351292a8","resolution":{"observed_at":"2026-08-06T00:56:04.922012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:05.012999Z","title":"Veritrail: Closed-domain hallucination detection with traceability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.012999Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:924d0ce8c853b4141bb762e5610a68dd79329a8b6dc324fc0dadc7025d2a4a81","observation_id":"9756f86a-b74a-4967-94e7-8ad6b900c0b6","resolution":{"observed_at":"2026-08-06T00:56:05.012999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:05.077103Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.077103Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:c2006bcfa0dc198dd5e3384913a9e2becda266b73a4a283c2c32ce4e55a5e21d","observation_id":"4798bd25-a7f3-4e9f-a766-58e4bf4991c8","resolution":{"observed_at":"2026-08-06T00:56:05.077103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:09.798582Z","title":"Introducing researcher and analyst in microsoft 365 copilot","venue":null,"work_id":"d4b7b525-70fa-48cd-b42f-0d0a37e969ca","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.166245Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:ab28c42674283716e9393626f7d15770ba4246c7599c0858580ea63c3e84e984","observation_id":"6ec2cfc2-eeac-4ba4-8f86-9ce3e30e4d2b","resolution":{"observed_at":"2026-08-06T00:56:09.910345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:09.624199Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":"b78eed11-678c-4683-9353-a841d30b52e1","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.311592Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:66295fb3ca048d8a185a1583fda7465eb55acdc91e184a53101a863767622b38","observation_id":"56e45693-eb36-4204-87b0-1c6c3cbe3d5c","resolution":{"observed_at":"2026-08-06T00:56:09.711474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:09.430631Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":"6362b666-8ab3-46f8-b713-b5b43654e43d","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.398991Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:fa06de92a784290a7b90d0a69ecf5634915f9a824abe6774a4f537c9ce5ff48b","observation_id":"1a1c0847-da88-4ed7-a1ac-210ce821edaf","resolution":{"observed_at":"2026-08-06T00:56:09.502455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:09.257953Z","title":"Introducing deep research","venue":null,"work_id":"00368d37-fbae-4e3f-be2a-4faccf3940d2","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.457585Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:4d43db2fbb221e95bbb110dcb5cbc0d2e2df6710e2bdb30ae61eeba8ea2b7c4b","observation_id":"f3641c16-58db-46f4-a2e3-c1d4b2e1732a","resolution":{"observed_at":"2026-08-06T00:56:09.331658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:09.054044Z","title":"Perplexity deep research","venue":null,"work_id":"4667edf6-434d-45f7-a313-42af88de250b","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.539963Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:6d9e8e54210a005fb1b7c631ee1b9cb6edb9c0825103f2c9c5e0fb835fbb61fc","observation_id":"939e8131-e079-4109-9648-ec56bbe920c3","resolution":{"observed_at":"2026-08-06T00:56:09.161922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:08.797771Z","title":"Sonar pro","venue":null,"work_id":"521e44b5-9a82-4c0d-acc7-08c9ee004c2f","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.639565Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:525d999874bc7cb54f5ac756dbd0d8511d30d3738df297a59ce471103794e0c7","observation_id":"3a430fc2-771c-4c86-be0b-655f4191d9a5","resolution":{"observed_at":"2026-08-06T00:56:08.924311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:08.586538Z","title":"Sonar reasoning","venue":null,"work_id":"155a0dbf-b44f-40da-9329-abc719d99f93","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.752392Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:b6b1928a9bcee27405858f99fdbf82d32b93632f5aff1fc820cfef9c924bcd3c","observation_id":"8a87cb7d-bf03-41b7-8375-c8ada03ce137","resolution":{"observed_at":"2026-08-06T00:56:08.664108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-06T00:56:05.839637Z","title":"Humanity's last exam","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.839637Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:083a00a6ccef972f8b4900acaa3145ba3b69beda4ee87056cf28f2969646ea25","observation_id":"1cf3a592-6fcc-481a-943f-6654d7210807","resolution":{"observed_at":"2026-08-06T00:56:05.839637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14207","last_updated":"2024-04-08T05:38:50Z","snapshot_observed_at":"2026-08-16T14:16:25.036966Z","submitted_at":"2024-02-22T01:20:17Z","title":"Assisting in Writing Wikipedia-like Articles From Scratch with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14207","snapshot_observed_at":"2026-08-06T00:56:05.908536Z","title":"Assisting in writing wikipedia-like articles from scratch with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.908536Z"},"links":{"cited_paper":"/paper/2402.14207","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:979d78cb9055e126be309446c5f11cc0860e370b20d330c0a93b4a197c799426","observation_id":"7db41a09-ac7a-44bb-85f7-d93f61f26b30","resolution":{"observed_at":"2026-08-06T00:56:05.908536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:05.979388Z","title":"Pangu deepdiver: Adaptive search intensity scaling via open-web reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:05.979388Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:9f6c49817f0b839a8c8cc9273a4b0103b8372f3477bc28cc5e2f8ddee286466f","observation_id":"2c4cd75a-5d68-4eb9-a54d-391f20305271","resolution":{"observed_at":"2026-08-06T00:56:05.979388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23194","last_updated":"2025-07-31T02:26:58Z","snapshot_observed_at":"2026-08-09T05:05:37.816527Z","submitted_at":"2025-07-31T02:26:58Z","title":"Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23194","snapshot_observed_at":"2026-08-06T00:56:06.062666Z","title":"Geak: Introducing triton kernel ai agent & evaluation benchmarks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:06.062666Z"},"links":{"cited_paper":"/paper/2507.23194","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:433bc640bdb2f2e0ff47e7a15875057f8423bad8cb55f885e9a7152190bdf709","observation_id":"03684cc1-1c48-4208-ac52-c0fc5903f379","resolution":{"observed_at":"2026-08-06T00:56:06.062666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-13T03:19:29.377723Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-06T00:56:06.248077Z","title":"Browsecomp: A simple yet challenging benchmark for browsing agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:06.248077Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:27c46a0a7a9a6d7e8b2da501208767ff73a8f5c092cc50ecef5dcba501db6e81","observation_id":"bb0a689d-f746-4cfe-ab35-ab456294fade","resolution":{"observed_at":"2026-08-06T00:56:06.248077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:08.432510Z","title":"Grok 3 beta — the age of reasoning agents","venue":null,"work_id":"a58a4f5e-ecdf-49df-b588-d9f06b94786a","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:06.363778Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:03b97526063f6b94fb6c59e7fcd7ab56637e105edff1f141c0d38753ddbda526","observation_id":"8d05bfba-f63d-4428-98c5-7f50e26485d5","resolution":{"observed_at":"2026-08-06T00:56:08.483853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-16T02:27:50.910548Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12594","snapshot_observed_at":"2026-08-06T00:56:06.477316Z","title":"A comprehensive survey of deep research: Systems, methodologies, and applications, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:06.477316Z"},"links":{"cited_paper":"/paper/2506.12594","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:0131783506e257a20dd8a66c6a06b31fb669a59cbb86ccc67d66793e107a7e1b","observation_id":"3f2aab72-d23c-48fd-aeab-4d798dc666c5","resolution":{"observed_at":"2026-08-06T00:56:06.477316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16280","last_updated":"2025-07-22T06:51:26Z","snapshot_observed_at":"2026-08-17T11:44:17.357235Z","submitted_at":"2025-07-22T06:51:26Z","title":"ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16280","snapshot_observed_at":"2026-08-06T00:56:06.611023Z","title":"Researcherbench: Evaluating deep ai research systems on the frontiers of scientific inquiry","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:06.611023Z"},"links":{"cited_paper":"/paper/2507.16280","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:a9828632148c78156f82fa28cf2a7007b617cd3ce097a0022fc8a732ef53b00f","observation_id":"77053ef7-0ad3-4000-9422-9ef41ea7db02","resolution":{"observed_at":"2026-08-06T00:56:06.611023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:06.728074Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:06.728074Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:c7df4b7b362b075bec4166aef56aeb786489ba03a58ab370d48c2e774187b9c7","observation_id":"93682201-ba35-45b8-bab6-622c2e40b46a","resolution":{"observed_at":"2026-08-06T00:56:06.728074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:56:08.234855Z","title":"Open deep research","venue":null,"work_id":"856de285-1806-4aee-b4e2-c9cb2c729e8a","year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:06.874170Z"},"links":{"citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:625ed265a29c0e8d8285671ee00951ba66f0b9a475396bc7c7509223ed6e8c3b","observation_id":"cd0aac83-49ef-486e-a35b-20aaa2520bca","resolution":{"observed_at":"2026-08-06T00:56:08.296610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-08-16T20:41:16.782304Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-06T00:56:06.963501Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:06.963501Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2508.04183"},"observation_digest":"sha256:e2777ac7d166bad149101c3949f386b6338e9e2584335fadee669cf4d66e884a","observation_id":"1eee2b58-4690-436a-b8aa-539bfd30cc12","resolution":{"observed_at":"2026-08-06T00:56:06.963501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.04183","last_updated":"2025-08-06T08:09:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T01:22:51.798570Z","submitted_at":"2025-08-06T08:09:28Z","title":"Characterizing Deep Research: A Benchmark and Formal Definition"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 7 inbound Pith citation observations for arXiv:2508.04183."}