{"as_of":"2026-08-08T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55579384590ab9f102e783c8a5b28fa53fdd04273f7236f32cbbf7efbd213b24","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T18:56:23.817544Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":61,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:26:56.603067Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-06T23:26:56.603067Z","title":"Webwatcher: Breaking new frontiers of vision-language deep research agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-06T23:20:46.744749Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:56.603067Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2506.18096"},"observation_digest":"sha256:1f23ec2f0d0d3f080582f34547567cba8798b90bbe9413f2c13d22c0972c096e","observation_id":"c5665ad9-e340-4a1e-9b73-9b821722e60d","resolution":{"observed_at":"2026-08-06T23:26:56.603067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":283,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:21ec980d2c7a9a39e2f04096694b3812f563b40631aadfb88fad632201be9492","observation_id":"e06f674b-d6b4-4622-9983-709648e89d1c","resolution":{"observed_at":"2026-05-18T19:21:48.586305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:55.500268Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2509.07969"},"observation_digest":"sha256:4f9fe976accf4a7f4c0bbfb8fd730852ceb4cc5f83664326a670a402049dc9ad","observation_id":"cf5555a3-91d0-472c-b320-e5c9e72f4d97","resolution":{"observed_at":"2026-05-18T01:17:55.644770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":159,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:25e0ecac53b1ec81be5b08985c2f1187483f031159325a148e8dbfb67a75f823","observation_id":"ba2045a0-37ff-4d05-a19b-a233e566c4a0","resolution":{"observed_at":"2026-05-18T00:02:25.446636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:a0328f8dd3a9541b1e9c34bff6b5b305c822039570bd5303e20ba2b69dc54549","observation_id":"2917a802-1ca4-4263-8138-551b4280f645","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T05:32:29.266583Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2511.05271"},"observation_digest":"sha256:0e377a12415f76e8524a0ec314a1dcda48577fb4b762aad8b6cb157f7bb329a7","observation_id":"12d06612-af7d-4170-9488-945c6a25002d","resolution":{"observed_at":"2026-05-16T05:32:29.566253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2601.22149","last_updated":"2026-04-17T18:27:53Z","snapshot_observed_at":"2026-08-03T05:49:10.484175Z","submitted_at":"2026-01-29T18:59:07Z","title":"DynaWeb: Model-Based Reinforcement Learning of Web Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T09:33:30.444057Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2601.22149"},"observation_digest":"sha256:698f758891caf9c22b89c046c9d364e52567d9141bfeeaff0843bbe5c39945aa","observation_id":"8275f9e2-84ef-4b02-b282-00c1add04fb5","resolution":{"observed_at":"2026-05-16T09:37:41.514211Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-02T20:40:30.373169Z","title":"Webwatcher: Breaking new frontier of vision-language deep research agent.arXiv preprint arXiv:2508.05748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-06T01:15:52.220969Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.373169Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:45870c3a86585da82040ce9c8f08a373bbe1a9cea28c0709f8e0ed0a59fa9981","observation_id":"7f4433c1-af72-4bb9-b18c-8b06d1776dcc","resolution":{"observed_at":"2026-08-02T20:40:30.373169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2603.04751","last_updated":"2026-04-27T08:53:25Z","snapshot_observed_at":"2026-07-31T05:56:51.116141Z","submitted_at":"2026-03-05T02:56:42Z","title":"Evaluating the Search Agent in a Parallel World","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T17:02:10.963839Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2603.04751"},"observation_digest":"sha256:103a16a4f5ddd72670966d62af5234860d3a44fdce23cf208448fe68fbe4fdb8","observation_id":"36d15297-3d43-4bd5-b8f9-6c0922e912e5","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T21:18:10.087258Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:9df8801c24525049c52deff1a0e6e426f6b6084744fab921a76991925413d0f1","observation_id":"820af3fc-8672-493b-b050-4b2ec880093a","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T06:31:13.232880Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:25124a2854b46ef98747adaf3fc42f1c8488e0b1dcfbfeb82b47f398a555fb57","observation_id":"dd1b7442-fd09-4dd2-80df-f7763f3c36a3","resolution":{"observed_at":"2026-05-25T06:35:25.175264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.04017","last_updated":"2026-04-05T08:29:52Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T08:29:52Z","title":"GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T17:31:08.575993Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.04017"},"observation_digest":"sha256:18eb4e205971010da6dba3969dd4a6655fa173838745d24c7fcba4bb5eb673de","observation_id":"6bccbf98-d5c7-46d3-ad74-040726d283e9","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-06T14:41:06.876472Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:d5c22f4d827829d8fdc51b1db509bcbb095782489b2ad32b325b3a4de5445cb8","observation_id":"7b074a6a-42d9-4f4d-b6d9-ebadc9e61e0c","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.09508","last_updated":"2026-04-10T17:25:34Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T17:25:34Z","title":"VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:21.088097Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.09508"},"observation_digest":"sha256:6121ce2027e00583b925e13ec6ac0ba456e7ad5aeba011a8e60f555d0427b7c2","observation_id":"4fe2c27f-2b7c-41d2-a98a-eae3194eb7df","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.10741","last_updated":"2026-04-19T17:04:51Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T17:30:44Z","title":"Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:42:35.824427Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.10741"},"observation_digest":"sha256:860824cbf6ed56b917402cd425574d02ee796e4722b289692fdcb1d2cb25b9af","observation_id":"503034a4-bb44-4dc9-89e5-530b27442ec9","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.11307","last_updated":"2026-04-13T11:07:08Z","snapshot_observed_at":"2026-07-06T22:59:45.139155Z","submitted_at":"2026-04-13T11:07:08Z","title":"PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:51:39.424754Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.11307"},"observation_digest":"sha256:f58a9389135328932e679ce9849b07bd596dcaf0cfadcf2a3c7dc022d4590174","observation_id":"9c833cf5-f319-4c0b-865c-1a4e9b1e6aac","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.12890","last_updated":"2026-04-25T02:32:57Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T15:40:28Z","title":"Towards Long-horizon Agentic Multimodal Search","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:40:32.137708Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.12890"},"observation_digest":"sha256:2400edfa898bf9b1800fd44bb804e4b7c99ec4ac34eca9a35f75da45b94a3a07","observation_id":"1a554a16-a74c-4636-a155-85442316779b","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-02T16:18:18.484070Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T13:09:24.304696Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:56344d9825dd1bf43ddcaa3a50a11eacbb94493d22a23aa8ed3fec739a1ae0f7","observation_id":"6dd5d7df-1fb5-404e-8fe0-4b0dfd57dea1","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-02T16:18:20.625700Z","title":"arXiv preprint arXiv:2508.05748 (2025) 3, 9, 11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-02T16:18:18.484070Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:20.625700Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:c6dd7febf3ccbc038261b8e8fa6d424a499d0f36c41e96f3c8cf169c4fedc454","observation_id":"ffa279fd-48a8-4c9a-946c-f5dc401d0c82","resolution":{"observed_at":"2026-08-02T16:18:20.625700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.19264","last_updated":"2026-04-21T09:28:34Z","snapshot_observed_at":"2026-07-31T12:03:21.545054Z","submitted_at":"2026-04-21T09:28:34Z","title":"DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-10T03:21:30.732925Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.19264"},"observation_digest":"sha256:65ef4878dc89dbbe7f75a577fe078da3a8292db0593d5a94621089c4cdea57b5","observation_id":"e45160d7-6dc6-4449-9820-7952aa799f3d","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.20486","last_updated":"2026-04-22T12:20:46Z","snapshot_observed_at":"2026-08-06T20:38:43.258492Z","submitted_at":"2026-04-22T12:20:46Z","title":"ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T01:12:17.469552Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.20486"},"observation_digest":"sha256:e89e987dbd1edbcc9d918b2578d8e61acbe35412b7747a212f8cc2da41f53d41","observation_id":"402544bc-25d2-4de5-b99b-466770a08906","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:b287e70bf565eae5ceb80eb78bd6540a192e80f76ed90ca9ce5b0a511666de24","observation_id":"5b9efe9e-9ddd-4c7e-9836-5fada0fa4c1e","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:b5c4facec33c925fdac75dd52d4a249654fd770e08a947d57dd58f2ac44e3efb","observation_id":"7b83d99e-7dc7-4b98-a7f6-6f1ce5e02178","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:3f2ae1d65004e318bf1a2332a24b317229b7a73135b8ed4e62f17c63b6fbb76a","observation_id":"b1a61f13-3a14-4d27-88c0-2a2cb97f9bba","resolution":{"observed_at":"2026-05-19T17:02:40.734170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.07177","last_updated":"2026-05-11T11:21:13Z","snapshot_observed_at":"2026-08-03T10:59:43.380213Z","submitted_at":"2026-05-08T03:16:08Z","title":"HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:28:36.266167Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.07177"},"observation_digest":"sha256:00911458413b65f428c445614568f07808d29745959b583c9ed0200cb6360c32","observation_id":"2b7fa124-5252-4e77-90ff-3fd61ebbe583","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.07177","last_updated":"2026-05-11T11:21:13Z","snapshot_observed_at":"2026-08-03T10:59:43.380213Z","submitted_at":"2026-05-08T03:16:08Z","title":"HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:18:01.006274Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.07177"},"observation_digest":"sha256:9709710ae1cacdc9dc54445d26ee68841e8658d78b57cb5c8200a5f097ab0990","observation_id":"d0d608c4-2264-4227-8fb3-4d911c741437","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.08762","last_updated":"2026-05-09T07:47:42Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:47:42Z","title":"Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:21:52.972107Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.08762"},"observation_digest":"sha256:4cf3d7922e65434d59cc8626023886cadaade0604195b513fc5f717517f25820","observation_id":"a655cd2f-6599-4831-89e8-f433ac23cea9","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.12497","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-08-02T08:24:58.437346Z","submitted_at":"2026-05-12T17:59:51Z","title":"From Web to Pixels: Bringing Agentic Search into Visual Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:43.959052Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.12497"},"observation_digest":"sha256:07d22a9afd5cee3ea4d2b0053972ba42e06c971a65682f48777635b004bb5f92","observation_id":"2f1efc30-0f67-4ba7-bd69-be5f89ac5d50","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.13034","last_updated":"2026-05-13T05:39:38Z","snapshot_observed_at":"2026-08-01T15:57:04.009723Z","submitted_at":"2026-05-13T05:39:38Z","title":"ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T19:18:52.801531Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.13034"},"observation_digest":"sha256:f6fc09b0a7f66576605c126c2c0192aa8f73404befd3b1e78dd6b9c7b1b5e9f8","observation_id":"af59cca7-70f7-4c3a-9247-d0d14a7aacb9","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.13193","last_updated":"2026-05-19T13:19:30Z","snapshot_observed_at":"2026-08-02T12:32:32.711675Z","submitted_at":"2026-05-13T08:49:51Z","title":"FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T20:25:36.746335Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.13193"},"observation_digest":"sha256:f80a827911152e6da40825b70ca348ddbbe52c14a54158fd7caeb05f4f18a3bc","observation_id":"0655a808-fe76-4928-9461-b2593ad1df10","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.13193","last_updated":"2026-05-19T13:19:30Z","snapshot_observed_at":"2026-08-02T12:32:32.711675Z","submitted_at":"2026-05-13T08:49:51Z","title":"FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T22:02:19.717335Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.13193"},"observation_digest":"sha256:568b63fec58c8cc1f71a5d333a669419bf20c0f348105c7709bf24dea22296fd","observation_id":"a736928e-a736-4e52-bc6c-443ec8e3549a","resolution":{"observed_at":"2026-05-20T22:03:47.201538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.13831","last_updated":"2026-05-13T17:52:53Z","snapshot_observed_at":"2026-08-06T00:20:13.394323Z","submitted_at":"2026-05-13T17:52:53Z","title":"Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T19:16:07.851098Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.13831"},"observation_digest":"sha256:b5366800650ec74ee926f249d9e1ad63faab5154d7d31dea28cfae344a42e9af","observation_id":"7b0e288d-a7f0-4f43-8c8b-7f1a43b2a071","resolution":{"observed_at":"2026-05-15T18:56:24.054213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.17531","last_updated":"2026-05-24T12:33:07Z","snapshot_observed_at":"2026-08-03T16:57:54.904543Z","submitted_at":"2026-05-17T16:30:44Z","title":"Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T13:38:21.492236Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.17531"},"observation_digest":"sha256:8c6e13aff8da77c152b5cf35e71b2571314c51d33fe082f67c2b0b6414b37aed","observation_id":"a2ff6fbc-a5e2-47f2-b78f-d6ebcc5accb2","resolution":{"observed_at":"2026-05-20T13:43:19.757653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.17531","last_updated":"2026-05-24T12:33:07Z","snapshot_observed_at":"2026-08-03T16:57:54.904543Z","submitted_at":"2026-05-17T16:30:44Z","title":"Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T19:07:05.208780Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.17531"},"observation_digest":"sha256:706dafdd5d2be2c7ad1c1bac0d1b248f5dadb41ea083b67b9e9c1ca8016fddc7","observation_id":"7249b038-2dac-4b4f-9a18-70814771cd9e","resolution":{"observed_at":"2026-06-30T19:15:01.021796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.17946","last_updated":"2026-05-20T03:33:36Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:03:48Z","title":"SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-20T10:08:56.397296Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.17946"},"observation_digest":"sha256:8176bdf30cdca03e85067c6bc42a9064b0165dd29b1681fb11258331e79f52ee","observation_id":"1dec591c-7eb6-4e14-978f-d87fec19beef","resolution":{"observed_at":"2026-05-20T10:13:12.017523Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.17946","last_updated":"2026-05-20T03:33:36Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:03:48Z","title":"SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-21T08:49:32.503461Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.17946"},"observation_digest":"sha256:9b2a135fc383ed1f1af2a50071d4af499818a187d9db177bf7b2043aa52b8c55","observation_id":"7f895b10-fbab-40c6-b091-7b5edb9fc2a2","resolution":{"observed_at":"2026-05-21T08:49:53.419752Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2605.27243","last_updated":"2026-07-06T16:46:07Z","snapshot_observed_at":"2026-07-12T15:54:10.049754Z","submitted_at":"2026-05-26T16:24:29Z","title":"Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:29:26.731925Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2605.27243"},"observation_digest":"sha256:120bee54835f47fcde36e556fdb5f0fa3bd27492a93017ea0398449969efa0d1","observation_id":"e5e8b6ac-6de9-4a93-996e-17d8e643d459","resolution":{"observed_at":"2026-06-29T18:33:50.544221Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:b6f630aff59cff85ecbb97117c664cc349b31e8d5b9f5632b1fabc5f9b5da47b","observation_id":"e50ccc53-2b6b-4b3d-8d8c-a69cb767320c","resolution":{"observed_at":"2026-06-28T20:22:37.711207Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.05784","last_updated":"2026-06-04T07:15:43Z","snapshot_observed_at":"2026-08-01T23:01:58.625715Z","submitted_at":"2026-06-04T07:15:43Z","title":"TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:11.638029Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.05784"},"observation_digest":"sha256:77938b24f448dd14b0897f6f3aa8e29d89d43c4182f2735ac17255541a7a1690","observation_id":"c9d5eefa-354f-4890-ab14-ba686bfd7a51","resolution":{"observed_at":"2026-07-02T12:16:57.776433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.07689","last_updated":"2026-06-05T06:25:11Z","snapshot_observed_at":"2026-07-06T23:47:19.773490Z","submitted_at":"2026-06-05T06:25:11Z","title":"Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T22:20:53.187362Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.07689"},"observation_digest":"sha256:21de25925777205ec64664f9b13ed5aa9e05614e0a86c91ac1f38423710a7222","observation_id":"d16a255a-209f-4411-92b5-b8d847858a47","resolution":{"observed_at":"2026-07-02T16:47:10.186792Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":270,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:4428f1595cf3bd21420d83db0bb4505211d41a67f3b19314a1bb1c6b0fd8d442","observation_id":"4e8908a4-db3e-4159-b517-d05ba0ef7b14","resolution":{"observed_at":"2026-06-27T09:50:48.464619Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.23997","last_updated":"2026-06-22T23:07:38Z","snapshot_observed_at":"2026-08-03T04:17:39.704462Z","submitted_at":"2026-06-22T23:07:38Z","title":"ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T06:02:40.752332Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.23997"},"observation_digest":"sha256:2b2600be6a5c18ed7c82181c7eff6f5c326d33d032542f66011f51ce25c8ee2e","observation_id":"144f6d7d-5000-4250-8505-b70cbed5271e","resolution":{"observed_at":"2026-07-04T12:49:52.168131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.24233","last_updated":"2026-06-23T07:22:22Z","snapshot_observed_at":"2026-08-06T19:51:08.157500Z","submitted_at":"2026-06-23T07:22:22Z","title":"Latent Visual States for Efficient Multimodal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T00:38:11.619574Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.24233"},"observation_digest":"sha256:167f388f0e1834c4cd98e34f0be76071ff9391dcf744c060e9679b89763d16c1","observation_id":"70d8f59e-a107-4500-b06a-1a1c4eea4dda","resolution":{"observed_at":"2026-07-04T16:29:57.263044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-04T23:24:39.482468Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:4ba1f8740ff2d9f768b00507cbbf5d5a85bbb0d16c3583938eea144778c69ded","observation_id":"5d9c1944-0cc8-4bbc-b61a-27e1eb4dd461","resolution":{"observed_at":"2026-07-04T19:20:06.665253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.27330","last_updated":"2026-06-25T17:44:48Z","snapshot_observed_at":"2026-08-03T00:40:31.745653Z","submitted_at":"2026-06-25T17:44:48Z","title":"Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T03:51:51.827622Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.27330"},"observation_digest":"sha256:a8f0b9a50688ec03a8533984fe8e4560f3f415581f77300d2720601b878e6183","observation_id":"47a7c605-d050-4f56-b92a-60970bc6e0dd","resolution":{"observed_at":"2026-07-04T14:29:53.361671Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.31229","last_updated":"2026-06-30T07:07:51Z","snapshot_observed_at":"2026-08-07T02:12:41.079426Z","submitted_at":"2026-06-30T07:07:51Z","title":"Agentic-Ideation: Sample Efficient Agentic Trajectories Synthesis for Scientific Ideation Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T05:49:52.979376Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.31229"},"observation_digest":"sha256:e9829a28479e573b593d4000491260b4305a903da957ff85bb5e940f4161616d","observation_id":"9c69a688-107c-4c3e-abfd-a5f5fa40a24d","resolution":{"observed_at":"2026-07-01T10:05:41.384777Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2606.31504","last_updated":"2026-06-30T11:22:24Z","snapshot_observed_at":"2026-08-02T16:40:34.907828Z","submitted_at":"2026-06-30T11:22:24Z","title":"SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-01T06:02:48.532478Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2606.31504"},"observation_digest":"sha256:c76be8579f3eb487303913bf6911c41da0097ca38cc517ad1d49eec4c5f55d86","observation_id":"b684a661-c7a1-4e4e-9a76-2df8839e7ce6","resolution":{"observed_at":"2026-07-01T09:55:41.130831Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2607.00508","last_updated":"2026-07-02T02:13:24Z","snapshot_observed_at":"2026-07-07T00:06:09.887791Z","submitted_at":"2026-07-01T06:43:55Z","title":"When RAG Meets Query Planning: Logical Query Trees for Resolving Exploratory Reasoning Problems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-02T06:47:57.679984Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.00508"},"observation_digest":"sha256:e03823669c335711d8c573a0b3ab32e7bc148dc82002a3d8f1afeb024218001f","observation_id":"6cc76311-02e7-4c67-b456-e86ee37c2194","resolution":{"observed_at":"2026-07-02T06:56:43.883868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2607.00508","last_updated":"2026-07-02T02:13:24Z","snapshot_observed_at":"2026-07-07T00:06:09.887791Z","submitted_at":"2026-07-01T06:43:55Z","title":"When RAG Meets Query Planning: Logical Query Trees for Resolving Exploratory Reasoning Problems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T19:05:04.593481Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.00508"},"observation_digest":"sha256:4bb3eed93c03e50257845a94f684eee1f975716c1e36c9a3031dfdd63fd2743b","observation_id":"633fe60b-42bb-4ede-9f82-35a552225014","resolution":{"observed_at":"2026-07-03T19:08:49.360613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-07-12T06:04:16.637378Z","title":"Webwatcher: Breaking new frontier of vision-language deep research agent.arXiv preprint arXiv:2508.05748, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02927","last_updated":"2026-07-03T03:50:09Z","snapshot_observed_at":"2026-08-07T23:48:33.179767Z","submitted_at":"2026-07-03T03:50:09Z","title":"VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:04:16.637378Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.02927"},"observation_digest":"sha256:873a7af45927432417f6562bdd661e56518ba05c1cc1fe267c03c3278523d032","observation_id":"7bf7bec7-5459-495d-869c-3fd177d991bb","resolution":{"observed_at":"2026-07-12T06:04:16.637378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2607.05943","last_updated":"2026-07-07T07:43:04Z","snapshot_observed_at":"2026-08-06T19:49:00.189467Z","submitted_at":"2026-07-07T07:43:04Z","title":"SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T20:04:30.942032Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.05943"},"observation_digest":"sha256:f87b2bb535805892e016a4e8252eea8a07807b6e179fa4ee2d6a9d269fbfa077","observation_id":"7c282df7-e02c-403c-bbea-5721de79ddd4","resolution":{"observed_at":"2026-07-08T20:05:34.061221Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2607.06374","last_updated":"2026-07-07T15:11:56Z","snapshot_observed_at":"2026-08-07T08:58:44.349689Z","submitted_at":"2026-07-07T15:11:56Z","title":"VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T08:00:31.873224Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.06374"},"observation_digest":"sha256:4b443d183537ade375ed0f3299aa6ccdc056a7ccd1bc00bcaa59e597cbf6190d","observation_id":"dd67ed7e-517d-47d8-9f84-5e275e848281","resolution":{"observed_at":"2026-07-08T08:04:48.031528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2607.07820","last_updated":"2026-07-13T12:09:44Z","snapshot_observed_at":"2026-08-07T16:54:25.126451Z","submitted_at":"2026-07-08T18:03:41Z","title":"DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T17:25:25.161103Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.07820"},"observation_digest":"sha256:e3046781efa5495b2ec3e83f70fc0f96ddc9c141f7dd1ccfcd2f8f16bfbc81d4","observation_id":"6575478c-4069-42f1-830d-a2a24755cb4e","resolution":{"observed_at":"2026-07-10T17:27:26.697652Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-07-14T15:41:28.727344Z","title":"arXiv preprint arXiv:2508.05748","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07820","last_updated":"2026-07-13T12:09:44Z","snapshot_observed_at":"2026-08-07T16:54:25.126451Z","submitted_at":"2026-07-08T18:03:41Z","title":"DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T15:41:28.727344Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.07820"},"observation_digest":"sha256:dc2de0e8230abbe7eb50b7b158ec2a4be64154325cf62a81c89d572720af503c","observation_id":"6e821f7b-1ac5-47b0-99a3-46c50c1f83e9","resolution":{"observed_at":"2026-07-14T15:41:28.727344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":"2508.05748","doi":"10.48550/arxiv.2407.01476","metadata_source":"pith","pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","venue":"cs.IR","work_id":"b734fd16-d7cf-4129-ac4d-129f31964890","year":2025},"citing_paper":{"arxiv_id":"2607.08448","last_updated":"2026-07-15T16:40:12Z","snapshot_observed_at":"2026-08-04T18:37:38.875340Z","submitted_at":"2026-07-09T13:08:54Z","title":"Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-10T07:18:57.823444Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.08448"},"observation_digest":"sha256:57526c2cd89e3296bcce393399028cb6ef67355568374279950e88210518c094","observation_id":"47fb2a3f-d067-4cca-b29b-07da7e062e2f","resolution":{"observed_at":"2026-07-10T07:26:54.432175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-02T07:56:56.599749Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08448","last_updated":"2026-07-15T16:40:12Z","snapshot_observed_at":"2026-08-04T18:37:38.875340Z","submitted_at":"2026-07-09T13:08:54Z","title":"Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T07:56:56.599749Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.08448"},"observation_digest":"sha256:03ca55cf2c45ce9c1ec71dd4a6f9fe4b36af2a6cf109f02757c1197e66f61e69","observation_id":"a100912a-4bb8-4824-822e-d1489526ba12","resolution":{"observed_at":"2026-08-02T07:56:56.599749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-07-14T10:51:16.019022Z","title":"arXiv preprint arXiv:2508.05748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10557","last_updated":"2026-07-12T04:13:27Z","snapshot_observed_at":"2026-08-07T19:26:40.944900Z","submitted_at":"2026-07-12T04:13:27Z","title":"UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-14T10:51:16.019022Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.10557"},"observation_digest":"sha256:3682f54fdafae36db6d336b58963ab48e35a61044189d24982e51df0fb6edbfa","observation_id":"3307efb3-a7f1-4fee-9362-b6166c78c5f1","resolution":{"observed_at":"2026-07-14T10:51:16.019022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-07-31T09:24:20.416024Z","title":"arXiv preprint arXiv:2508.05748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28374","last_updated":"2026-07-30T15:35:34Z","snapshot_observed_at":"2026-08-03T00:11:50.870024Z","submitted_at":"2026-07-30T15:35:34Z","title":"LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T09:24:20.416024Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2607.28374"},"observation_digest":"sha256:d575d59b6a1e88b2e8f8ab841d6dac7e73fd2bf7f50dbe0bc75723ef9049f6b1","observation_id":"d8113168-6b42-40be-80c6-509dd82f840f","resolution":{"observed_at":"2026-07-31T09:24:20.416024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-04T20:12:42.009030Z","title":"10 Preprint Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01827","last_updated":"2026-08-03T07:36:48Z","snapshot_observed_at":"2026-08-06T23:33:16.981285Z","submitted_at":"2026-08-03T07:36:48Z","title":"DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:12:42.009030Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2608.01827"},"observation_digest":"sha256:21b40f4d3ee625754437affe332ae8472426e13adffd1a13b664a840b72f26db","observation_id":"2d81ff00-6fa5-4cca-96d8-eb93c7f3c713","resolution":{"observed_at":"2026-08-04T20:12:42.009030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-04T11:21:31.750266Z","title":"arXiv preprint arXiv:2508.05748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02217","last_updated":"2026-08-03T13:38:37Z","snapshot_observed_at":"2026-08-07T11:12:13.500360Z","submitted_at":"2026-08-03T13:38:37Z","title":"VC-Tooler: Learning Compositional and Adaptive Visual Tool Use","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:21:31.750266Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2608.02217"},"observation_digest":"sha256:fcb6bf221dabd2277ec66dab1f4cbb316fb5690d726291f5e2c9fa368fc87009","observation_id":"4f6d35e9-fb6f-426c-a75b-6bbbdf13e80f","resolution":{"observed_at":"2026-08-04T11:21:31.750266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T04:44:28.969281Z","title":"arXiv preprint arXiv:2508.05748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-07T23:12:46.543112Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.969281Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:63a224fdc973072f5e5bc43ebdcf1b9ce113344862524cb4fe127ad2b34b4cc3","observation_id":"93872b99-4b08-4ebc-bb94-d7dcbdde654e","resolution":{"observed_at":"2026-08-05T04:44:28.969281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05748/citation-record","integrity":"/paper/2508.05748/integrity","json":"/paper/2508.05748/citation-record.json","paper":"/paper/2508.05748"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:adca503f730265783ec012bc569def5d5d661005f2b8783f7e5c30c62e46daee","observation_id":"d4bd7a48-51bf-435e-ba07-6ad6cb3d9cd1","resolution":{"observed_at":"2026-05-15T18:56:23.915900Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.03151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why reasoning matters? a survey of advancements in multimodal reasoning (v1)","venue":null,"work_id":"776ae2d4-b7ef-445f-be80-6568ff81d28e","year":null},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:8edd9a611a869b0f74950d386503c160d28a3800156867895d230439832d15b2","observation_id":"a15cbc98-4ab1-4f8e-beb2-7e60657564d3","resolution":{"observed_at":"2026-05-15T18:56:23.857412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T04:13:14.044604Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:5718e5458651b9f32a04323664f2a54b44328381fc3c6e87a1cb4458f3c5f02c","observation_id":"e4c2ebe9-4399-4cfe-ae47-0b775b4bcd14","resolution":{"observed_at":"2026-05-15T18:56:23.864934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:2798a01fd8a698476757eb7cef55bab50b88d7d8ae9a7770a55be8c85f0ecea8","observation_id":"499edf28-5844-4674-ab3d-bcb80ccd7474","resolution":{"observed_at":"2026-05-15T18:56:23.872966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-07T03:19:53.953867Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":"2302.11713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-07-04T10:59:46.832017Z","title":"Can pre-trained vision and language models answer visual information-seeking questions?","venue":null,"work_id":"b7899c66-9ee1-45bf-8a1d-223b8959dee6","year":2023},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:ecabefc632526cd69ef4c07694c728a2e106abfe4fa2bfb877e85d481644da1e","observation_id":"76c4a3da-e9a7-4fa5-b398-b019731279ff","resolution":{"observed_at":"2026-05-15T18:56:23.880172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18023","last_updated":"2025-08-25T13:17:09Z","snapshot_observed_at":"2026-08-07T17:50:41.477468Z","submitted_at":"2025-02-25T09:32:08Z","title":"Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference","version":3},"cited_work":{"arxiv_id":"2502.18023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18023","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting knowledge boundary of vision large language models by sampling-based inference","venue":null,"work_id":"a75d70a2-5ca3-4056-a3db-a47e6aa7044d","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2502.18023","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:74a6f219bbf794163faa9760ee0f8aba2959095989bb8bdfd890384d7b1fe0c9","observation_id":"a1f07c42-8af2-451e-b620-24358f1f71ef","resolution":{"observed_at":"2026-05-15T18:56:23.887970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13059","last_updated":"2025-02-18T17:04:26Z","snapshot_observed_at":"2026-08-07T18:07:45.008519Z","submitted_at":"2025-02-18T17:04:26Z","title":"SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.13059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13059","snapshot_observed_at":"2026-07-03T04:27:37.001216Z","title":"SimpleVQA: Multimodal factuality evaluation for multimodal large lan- guage models.arXiv preprint arXiv:2502.13059","venue":null,"work_id":"7361c370-5f61-4dc9-b6dc-07820cd870cf","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2502.13059","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:eb1b2e2659eb6cc803edac62c17c2adf5cf68faf339cc261ce26fd5ad2447ee0","observation_id":"08bc7117-0e4f-42c3-be50-d03b44bf8b8c","resolution":{"observed_at":"2026-05-15T18:56:23.895091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00535","last_updated":"2025-05-12T10:24:14Z","snapshot_observed_at":"2026-07-06T19:59:28.832182Z","submitted_at":"2024-11-30T16:58:42Z","title":"FullStack Bench: Evaluating LLMs as Full Stack Coders","version":6},"cited_work":{"arxiv_id":"2412.00535","doi":"10.48550/arxiv.2412.00535","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00535","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fullstackbench: Evaluatingllmsasfullstackcoders","venue":"arXiv (Cornell University)","work_id":"569bc5cb-f61d-4b46-8553-07cf2b67cece","year":2024},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2412.00535","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:9d6b1ef7a5b14f256c1105dd94594b0aadf61275bb06f50fb1911bd9fc07e26e","observation_id":"06a31577-b3b6-41d8-a96b-58f6ee127d9c","resolution":{"observed_at":"2026-05-15T18:56:23.902839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yuhao Dong, Zuyan Liu, Hai-Long Sun, Jingkang Yang, Winston Hu, Yongming Rao, and Ziwei Liu","venue":null,"work_id":"e4f1d7f0-584a-4064-9800-7561ad610c7a","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:fceb4f6f7991c1e3660ace1da922af8c53b53c0810be188c56cf273569a9705c","observation_id":"1c89c951-07b8-4fb4-857b-98a3de03a057","resolution":{"observed_at":"2026-05-15T18:56:24.048466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05288","last_updated":"2025-07-01T02:17:31Z","snapshot_observed_at":"2026-08-07T16:07:52.262336Z","submitted_at":"2025-04-07T17:39:31Z","title":"Seeking and Updating with Live Visual Knowledge","version":2},"cited_work":{"arxiv_id":"2504.05288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.05288","snapshot_observed_at":"2026-07-04T10:59:46.865978Z","title":"Livevqa: Live visual knowledge seeking","venue":null,"work_id":"9c3a30df-d4d6-4c09-bef9-7b59689aa66c","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2504.05288","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:f0e01a7ce0e1f72afc526717646d2c54c108e632fc25e85d1c3be4e74fbc7b4d","observation_id":"9bf24133-f692-496d-b86a-d713551450a5","resolution":{"observed_at":"2026-05-15T18:56:23.922842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00842","last_updated":"2025-07-24T19:34:51Z","snapshot_observed_at":"2026-08-07T12:22:22.070662Z","submitted_at":"2025-06-01T05:22:00Z","title":"Toward Structured Knowledge Reasoning: Contrastive Retrieval-Augmented Generation on Experience","version":2},"cited_work":{"arxiv_id":"2506.00842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00842","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward structured knowledge reasoning: Contrastive retrieval-augmented generation on experience","venue":null,"work_id":"6777b28b-c337-4486-9262-2c163a4f715e","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2506.00842","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:c7668ff66324c18bfeafb1d4988b249ee26dfcafa8c72ca3fff66cdbbba1c85d","observation_id":"d5fc73ca-9b82-466a-8a88-91440c9e06d0","resolution":{"observed_at":"2026-05-15T18:56:23.929624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:6a153d67cb4c0cdd9956691342aff93d91cec4aeb5822e2dd931f4feae46a843","observation_id":"28812c4e-aa19-49d7-b707-b9c88ffe31e0","resolution":{"observed_at":"2026-05-15T18:56:23.936880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23885","last_updated":"2025-06-11T01:42:53Z","snapshot_observed_at":"2026-08-07T22:31:50.319614Z","submitted_at":"2025-05-29T17:51:58Z","title":"OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation","version":2},"cited_work":{"arxiv_id":"2505.23885","doi":"10.48550/arxiv.2505.23885","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23885","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.23885 , year=","venue":"ArXiv.org","work_id":"f267e37d-ab4f-4288-8cfe-389d3a6da414","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2505.23885","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:433dd8b45414fe374732a47edf5afa8e572813c95e54409488abd4fcd5dffd9c","observation_id":"89b0f690-1830-4613-b407-6e923d38572a","resolution":{"observed_at":"2026-05-15T18:56:23.944685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17163","last_updated":"2026-05-26T01:50:12Z","snapshot_observed_at":"2026-08-07T14:52:59.748689Z","submitted_at":"2025-05-22T15:25:14Z","title":"OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning","version":2},"cited_work":{"arxiv_id":"2505.17163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17163","snapshot_observed_at":"2026-07-04T21:00:09.510505Z","title":"Ocr-reasoning benchmark: Unveiling the true capabilities of mllms in complex text-rich image reasoning","venue":"cs.LG","work_id":"049a1737-1d31-4d8f-9fe2-6232eb147ff8","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2505.17163","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:358bee3919b449791c9a5e08f9bdd5cf8e5dd1828499d77255801ab1cb4caf5b","observation_id":"b7e4f7ab-7720-4187-ae82-22e5d575534c","resolution":{"observed_at":"2026-05-27T02:04:28.324233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12959","last_updated":"2024-11-27T08:49:12Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:45Z","title":"MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines","version":2},"cited_work":{"arxiv_id":"2409.12959","doi":"10.48550/arxiv.2409.12959","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12959","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bowen Jin, Hansi Zeng, Zhenrui Yue, Jinsung Yoon, Sercan Arik, Dong Wang, Hamed Zamani, and Jiawei Han","venue":"arXiv (Cornell University)","work_id":"d0ff946f-7130-4450-bc8f-42251af6e2c8","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2409.12959","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:bcef94ca7791fe9d9e9e677eac730ba09c93e65eda94c65de484f110105f396b","observation_id":"6320c711-898e-4ac0-90cc-f39425bca9d7","resolution":{"observed_at":"2026-05-15T18:56:23.959929Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-06T06:12:37.171726Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":"2507.02592","doi":"10.48550/arxiv.2507.02592","metadata_source":"pith","pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","venue":"cs.CL","work_id":"fec5a195-1dd5-425a-b552-109af948a7dd","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:e8ff8a9944c2a09e28b66662e291cbc0c0df7602f1d7a477af20815e2fe7900f","observation_id":"bef75ba1-73ff-4487-bdcc-a4ae44e0fb8b","resolution":{"observed_at":"2026-05-17T15:37:09.773663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thomas Mensink, Jasper Uijlings, Lluis Castrejon, Arushi Goel, Felipe Cadar, Howard Zhou, Fei Sha, André Araujo, and Vittorio Ferrari","venue":null,"work_id":"b5a4d012-69ce-4933-9910-a34c34d013e7","year":2024},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:8840d8f38085155c876ad81b06508e7abef0cdd8e5ea33eebf0dc5dec4d7de8d","observation_id":"22521279-05b7-4ede-be3c-007bf6381880","resolution":{"observed_at":"2026-05-15T18:56:24.052950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":"2501.14249","doi":"10.1038/s41586-025-09962-4","metadata_source":"pith","pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Humanity's Last Exam","venue":"cs.LG","work_id":"59ea00d4-16a8-45e1-aafc-290a6f91d9f4","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:ed3da6e277c66bfae3b5cab5bc297eaaaa3c6ca69d31b6d26b0b7e8979edd48e","observation_id":"357233fc-e9f1-40f4-a029-ff02ee2e2435","resolution":{"observed_at":"2026-05-15T18:56:23.980780Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":"2305.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-07-03T23:49:02.294828Z","title":"Visual chain of thought: bridging logical gaps with multimodal infillings","venue":null,"work_id":"64fb27c2-faa6-417b-84d7-68c8866ca1e4","year":2023},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:62829c7cdebc7ed0979e69a40215881d7b5f0577ef250b811b992d23f3ecbed2","observation_id":"1d9134d9-2d67-4ef6-8865-6454a3103638","resolution":{"observed_at":"2026-05-15T18:56:23.987203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:f17df2d53d40180ebddfe3b6e37de125c3a4d91ef12df46c9b1a0a9332641da0","observation_id":"8014801f-cc3f-4541-a341-24145d26a7c2","resolution":{"observed_at":"2026-05-15T18:56:23.992073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18134","last_updated":"2024-06-26T07:38:24Z","snapshot_observed_at":"2026-07-06T18:37:08.729847Z","submitted_at":"2024-06-26T07:38:24Z","title":"Assessing \"Implicit\" Retrieval Robustness of Large Language Models","version":1},"cited_work":{"arxiv_id":"2406.18134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18134","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"implicit","venue":null,"work_id":"b3e0fb89-07e7-4ce8-9443-75491dc2c578","year":null},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2406.18134","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:d10c4147331617ca36787d0496f1268e8ccf2bb52eefa1815ddf429b4466dc79","observation_id":"ee46ac06-1f6f-40ea-932f-c54783cf6fa3","resolution":{"observed_at":"2026-05-15T18:56:23.997401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.05592","doi":"10.48550/arxiv.2503.05592","metadata_source":"pith","pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","venue":"cs.AI","work_id":"f5ed73d2-f2ff-4cf6-853d-3586333e44ef","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:a78fd8472dd92e61dfa92c992f6587c1b079bcd5a1294cc1ab85c06d2c77583d","observation_id":"0418bf23-1913-45d5-9e3a-b51bc9548e61","resolution":{"observed_at":"2026-05-15T18:56:24.002556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.08617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-07-04T20:10:07.295499Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","venue":"cs.CV","work_id":"3939edf9-d5d5-4c79-bd9c-02e7961fda21","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:e5e41ac9910811fcf5be9e6d4ec9b3912f538d975229ca0992271755aabf3766","observation_id":"a8097119-183a-4e24-b0ff-e5c84960d97a","resolution":{"observed_at":"2026-05-16T22:13:13.788897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15061","last_updated":"2025-07-20T17:53:37Z","snapshot_observed_at":"2026-08-07T15:23:29.739057Z","submitted_at":"2025-07-20T17:53:37Z","title":"WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization","version":1},"cited_work":{"arxiv_id":"2507.15061","doi":"10.48550/arxiv.2507.15061","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15061","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Webshaper: Agentically datasynthesizingviainformation-seekingformalization.arXivpreprint","venue":null,"work_id":"ed437781-612e-405b-916f-243b6f4d1443","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2507.15061","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:0d806e5da6408666c4769fe2d003048bedbf6b7605f79dde4cbb1178a7958b6f","observation_id":"0e52505f-8ea4-4214-8a84-daf5d6ce139b","resolution":{"observed_at":"2026-05-15T18:56:24.014124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":"2504.12516","doi":"10.48550/arxiv.2504.12516","metadata_source":"pith","pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","venue":"cs.CL","work_id":"25adb508-d97c-49d6-ae43-7a70c2478a34","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:06e8196085389fe6f9a0be035c8cd4138c2797557e5203b026013e35a60eac55","observation_id":"90c1f86a-9076-421d-9b75-43c0b280e8b1","resolution":{"observed_at":"2026-05-15T18:56:24.021133Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-07T11:53:13.790399Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"cited_work":{"arxiv_id":"2506.12594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12594","snapshot_observed_at":"2026-07-04T00:49:18.499651Z","title":"& Peng, J","venue":null,"work_id":"e55e4a14-6644-4fe9-8624-14221ff43bb7","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2506.12594","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:7c4a7eccfc84f23d2b7954f57501022f930fb7b268790115b2bbce32b193ab79","observation_id":"c3c255b3-2864-451a-b5a5-b941577cd2e1","resolution":{"observed_at":"2026-05-15T18:56:24.027581Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":"2404.16006","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-07-04T19:50:10.187396Z","title":"Mmt-bench: A comprehensive multimodal benchmark for eval- uating large vision-language models towards multitask agi","venue":null,"work_id":"b311f9ac-1b41-40b6-b154-df5836a51696","year":2024},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:c26e5c71f0597f507584e48540462a5bcd33750ff6577896f7364675728ef27f","observation_id":"623233a9-efc2-4d9b-826d-7f857dfd8e81","resolution":{"observed_at":"2026-05-15T18:56:24.034271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:7b845ae64e9db1b5d9e72e442e45869d2eda5baafc909a86aa0e3da71ded471d","observation_id":"ab0a14ae-da34-4a13-8fb7-81a7de51354c","resolution":{"observed_at":"2026-05-15T18:56:24.039726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07998","last_updated":"2025-08-27T07:42:56Z","snapshot_observed_at":"2026-08-07T15:21:56.692035Z","submitted_at":"2025-07-10T17:59:55Z","title":"PyVision: Agentic Vision with Dynamic Tooling","version":3},"cited_work":{"arxiv_id":"2507.07998","doi":"10.48550/arxiv.2507.07998","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2507.07998 , year=","venue":"ArXiv.org","work_id":"baf608ff-7eeb-4238-bf28-c54581129d83","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2507.07998","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:8bbd11c0c159d0af2378904cf683d4652af6dc27f7dca37b6fc41da4f0cdf067","observation_id":"af2c8f61-5ca4-4d2f-a1c4-f5ebfe77fa78","resolution":{"observed_at":"2026-05-15T18:56:24.044382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":"2504.03160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-07-03T04:37:37.738752Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","venue":"cs.AI","work_id":"460d8021-a193-45c3-89a7-b72f6767c87f","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:437375a22b39e794e72b191e74509905d6a830200479402eac679549e054be90","observation_id":"2afbc784-1962-4708-a775-7b80ee1d7563","resolution":{"observed_at":"2026-05-16T19:58:59.023888Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15741","last_updated":"2025-06-23T09:22:39Z","snapshot_observed_at":"2026-08-07T15:22:56.137368Z","submitted_at":"2025-06-17T17:59:02Z","title":"OAgents: An Empirical Study of Building Effective Agents","version":2},"cited_work":{"arxiv_id":"2506.15741","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15741","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OAgents: An empirical study of building effective agents","venue":null,"work_id":"5422f07b-2ffd-48a9-9c12-12e28b7d6842","year":2025},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2506.15741","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:782423c08e8f7d2d770d33b297eefed32c6fd100719284a03eb7ccb04d211366","observation_id":"703b22d4-151c-4059-879e-d92854343ae8","resolution":{"observed_at":"2026-05-15T18:56:23.848489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","latest_version":3,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":9,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":2},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 61 inbound Pith citation observations for arXiv:2508.05748."}