{"as_of":"2026-08-13T15:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c969913b65e541dba73580cf906d9cf49d5afdf765f27594cedd3a7453dce951","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:44:32.473958Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03979/citation-record","integrity":"/paper/2608.03979/integrity","json":"/paper/2608.03979/citation-record.json","paper":"/paper/2608.03979"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-11T20:27:48.604281Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-08-05T04:44:27.203082Z","title":"arXiv preprint arXiv:2505.22019 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.203082Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:6d9277709f272ed8bc59f97b619acfa0eeef7d16e033c8acc96a5b6b1fc4c04d","observation_id":"07c32dab-92fe-471c-a56d-9a84f9aad946","resolution":{"observed_at":"2026-08-05T04:44:27.203082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-10T14:43:33.791354Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T04:44:27.295574Z","title":"5-omni technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.295574Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:aa13e333a4cff0f0abbc6cb65ad7c72fdcae223a9bced40af171b1224cd731d3","observation_id":"a50a00fc-ade3-4222-aaa8-9188f8a7fb9d","resolution":{"observed_at":"2026-08-05T04:44:27.295574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07956","last_updated":"2025-04-10T17:59:03Z","snapshot_observed_at":"2026-08-07T16:06:45.494945Z","submitted_at":"2025-04-10T17:59:03Z","title":"VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07956","snapshot_observed_at":"2026-08-05T04:44:27.371880Z","title":"arXiv preprint arXiv:2504.07956 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.371880Z"},"links":{"cited_paper":"/paper/2504.07956","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:e88af30437eed111e24f9c29280737c9b91e1d045cdec22874f5cddf81bc7342","observation_id":"3b8658af-e80d-41ee-954c-72225ab03aae","resolution":{"observed_at":"2026-08-05T04:44:27.371880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-05T04:44:27.468763Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.468763Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:70f4e3d39e66bde3f31aa360d40df22b1e530afe971f59b07b5deea1402597ab","observation_id":"72a4bef8-678f-484b-91b9-3bd47f45f266","resolution":{"observed_at":"2026-08-05T04:44:27.468763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:36.058793Z","title":null,"venue":null,"work_id":"843aeb29-d87d-412a-a226-06c6b247b702","year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.491048Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:6d1c9034e74ea2eaf88e05382a4d545f7132caaa8339b469fff9b08be3e262c2","observation_id":"24579356-993c-4206-8feb-9216a76b1c50","resolution":{"observed_at":"2026-08-05T04:44:36.137174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:27.545939Z","title":"arXiv preprint arXiv:2601.22060 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.545939Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:0757ac01b82d84c27f8fe9d8f49a8d6d4db3523eefade364f872a28b3cb7a1f9","observation_id":"8497ac67-a285-40e7-acc5-e1452a4a9c0e","resolution":{"observed_at":"2026-08-05T04:44:27.545939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06943","last_updated":"2026-05-18T06:58:21Z","snapshot_observed_at":"2026-08-12T12:48:55.874618Z","submitted_at":"2026-01-11T15:07:37Z","title":"Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06943","snapshot_observed_at":"2026-08-05T04:44:27.675736Z","title":"arXiv preprint arXiv:2601.06943 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.675736Z"},"links":{"cited_paper":"/paper/2601.06943","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:ce0b227ad321f3c640046da76a6199b153abaef52a1c1588382b13a1e586f5b1","observation_id":"066cc371-bfe7-41c3-a0a0-cb2a65ff824a","resolution":{"observed_at":"2026-08-05T04:44:27.675736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T04:44:27.712772Z","title":"arXiv preprint arXiv:2601.03267 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.712772Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:163eda2daf57071702db3f5d89149cb563169eed25e0feeeef27ee143872608f","observation_id":"0053b198-a6bf-4a4a-bfa7-edbc5a969a16","resolution":{"observed_at":"2026-08-05T04:44:27.712772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:27.756752Z","title":"arXiv preprint arXiv:2503.17736 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.756752Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:083532ba968886e90dabd8c5068b7cabfc798c172df109e7a8834a088dd4160f","observation_id":"3f93d5c3-1b82-428c-9f88-138f0981786b","resolution":{"observed_at":"2026-08-05T04:44:27.756752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:27.789044Z","title":"arXiv preprint arXiv:2510.01304 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.789044Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:1d9006ea3da5ea24e82f38e122227ddf59ce38bb161aa725747af3be3dd8e647","observation_id":"4501895f-dd9e-4dbe-825e-6fae3ace9fae","resolution":{"observed_at":"2026-08-05T04:44:27.789044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T04:44:27.880473Z","title":"arXiv preprint arXiv:2503.06749 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.880473Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:0cd236079d8e7cf9b3d8d821b8da093a19a5254d830142e1121f4cac46fc1fdc","observation_id":"fe893917-5459-49c5-b0a6-37e3b86c925b","resolution":{"observed_at":"2026-08-05T04:44:27.880473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-12T04:43:44.229948Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-05T04:44:27.956682Z","title":"arXiv preprint arXiv:2410.10594 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:27.956682Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:26c3e76c6b0c1f9bdadfacc3d1ced87da5a9b51ea41c6ec40fd9854086ac8e4d","observation_id":"944333b8-061f-453f-8787-94df744891f6","resolution":{"observed_at":"2026-08-05T04:44:27.956682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.010688Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.010688Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:f6c5a53fa9fc6b21c1ef6fcdeae300bf8b32d588a7e40532bf7acf42bcf597a2","observation_id":"89d57bf1-71b3-4fc6-ab0d-f91f05759ae7","resolution":{"observed_at":"2026-08-05T04:44:28.010688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.072160Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.072160Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:680c25b81a1e876f610d84a61b9fe25de470742e59ae969d72164bacd607b35c","observation_id":"d364a7f1-1aee-41cc-914f-30a67aab5a2b","resolution":{"observed_at":"2026-08-05T04:44:28.072160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.135146Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.135146Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:65e736acd71ab5c5f3b0577041321cb08f30184eecbcc4cddb08b69c76f8f823","observation_id":"030cf6ed-183c-4cb8-8ab7-b2d7f1330bff","resolution":{"observed_at":"2026-08-05T04:44:28.135146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.197665Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.197665Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:a1a95e6004a465a08643114888a3152e3051497046fc0e26bb123f56ac188c07","observation_id":"0fce546a-b5be-478b-99ee-a3188c212469","resolution":{"observed_at":"2026-08-05T04:44:28.197665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.258543Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.258543Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:986d31bab825588a0bd18bb1f3e8c937a0a3fc31ad48f80ed49e4424e061d412","observation_id":"7f3e6fec-a6c0-4ea9-94c1-9ee706bf5810","resolution":{"observed_at":"2026-08-05T04:44:28.258543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.318851Z","title":"arXiv preprint arXiv:2601.03193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.318851Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:65c5572ceaef747216b5b4c676cb3e5c8ad7c89be254f786d1590195d6bed3b6","observation_id":"6263cb7b-7c51-44cd-98ef-84d851c2d80d","resolution":{"observed_at":"2026-08-05T04:44:28.318851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.379916Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.379916Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:74227011c8d1d11d43b85cdfd99d7922b580566a97846d7ba424c8a3df515c4f","observation_id":"e3544784-064c-427d-8fdb-2f8c6f9a08c1","resolution":{"observed_at":"2026-08-05T04:44:28.379916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.406524Z","title":"arXiv preprint arXiv:2511.22134 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.406524Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:8f3d64c7bfe11d5eef95c60aba9aec15248f7de5e7a9de1dff93a675d19bab10","observation_id":"7b605e53-04d2-4b19-91bb-36281c8f2109","resolution":{"observed_at":"2026-08-05T04:44:28.406524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-10T03:50:19.629094Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13977","snapshot_observed_at":"2026-08-05T04:44:28.494145Z","title":"arXiv preprint arXiv:2506.13977 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.494145Z"},"links":{"cited_paper":"/paper/2506.13977","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:aacc2af88720622e190213950744bb61f85937ac9f8dc9c441e4c700e320d7de","observation_id":"da4b10f7-2315-4881-8542-3bc14fb3835f","resolution":{"observed_at":"2026-08-05T04:44:28.494145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-12T19:13:52.636156Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06945","snapshot_observed_at":"2026-08-05T04:44:28.524092Z","title":"arXiv preprint arXiv:2509.06945 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.524092Z"},"links":{"cited_paper":"/paper/2509.06945","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:48e47aff335c8f5b447367592c6929a837549e82fcf66aeb0aeb0937319156cf","observation_id":"097f2bcd-f015-46ea-b082-5db26a881451","resolution":{"observed_at":"2026-08-05T04:44:28.524092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05288","last_updated":"2025-07-01T02:17:31Z","snapshot_observed_at":"2026-08-10T13:24:26.889977Z","submitted_at":"2025-04-07T17:39:31Z","title":"Seeking and Updating with Live Visual Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05288","snapshot_observed_at":"2026-08-05T04:44:28.589607Z","title":"arXiv preprint arXiv:2504.05288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.589607Z"},"links":{"cited_paper":"/paper/2504.05288","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:d93df8a688289c58f907709ee0ae77d31e5ecf604d10f9ea04db1ccc57a77a4e","observation_id":"9075839e-afea-4ee5-babc-20563e17991c","resolution":{"observed_at":"2026-08-05T04:44:28.589607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-08-05T04:44:28.704735Z","title":"arXiv preprint arXiv:2506.20670 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.704735Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:5d84c028fd439b09a201864a11c801f3879d507ffd6e8938cae84c1687f7f3d2","observation_id":"637e9dc8-9f97-41b9-8b13-f92c671435e6","resolution":{"observed_at":"2026-08-05T04:44:28.704735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:28.859609Z","title":"arXiv preprint arXiv:2510.12801 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.859609Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:807527ccb59111e838d40c632f15d1250ca65d1d11cf784184015ebcdb3c144e","observation_id":"4a65b9b0-cea0-4aaa-9adf-de440fdf79f1","resolution":{"observed_at":"2026-08-05T04:44:28.859609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-12T15:21:22.765600Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-05T04:44:28.969281Z","title":"arXiv preprint arXiv:2508.05748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.969281Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:bac59e148268e72528394097b53d50b08f1be47bef20b36b3a9f47b58250b6ba","observation_id":"93872b99-4b08-4ebc-bb94-d7dcbdde654e","resolution":{"observed_at":"2026-08-05T04:44:28.969281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-05T04:44:29.094287Z","title":"arXiv preprint arXiv:2511.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.094287Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:f0b1a0e5c300eb0d13960a489647af23f41210e5396cf0c34c07e88b7a84a6cb","observation_id":"8fcf68b2-ada1-4deb-8469-b9e11ef52053","resolution":{"observed_at":"2026-08-05T04:44:29.094287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24701","last_updated":"2026-05-18T04:10:32Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:53:02Z","title":"Tongyi DeepResearch Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.24701","snapshot_observed_at":"2026-08-05T04:44:29.189555Z","title":"arXiv preprint arXiv:2510.24701 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.189555Z"},"links":{"cited_paper":"/paper/2510.24701","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:ef54dcc1fff2b94ea3224bcd92565e6d2ec119e8948466043c078e98cfc69520","observation_id":"635dcb0e-469e-4277-af42-37fa7bfef9cc","resolution":{"observed_at":"2026-08-05T04:44:29.189555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-07T13:00:07.473210Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22648","snapshot_observed_at":"2026-08-05T04:44:29.293979Z","title":"arXiv preprint arXiv:2505.22648 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.293979Z"},"links":{"cited_paper":"/paper/2505.22648","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:e3918d826e3687837b077943650d9316337be5493ec7957aef024d56affde27b","observation_id":"4b2f2681-3270-418e-bf12-105ca9a541a8","resolution":{"observed_at":"2026-08-05T04:44:29.293979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-12T16:37:55.786203Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-05T04:44:29.403241Z","title":"arXiv preprint arXiv:2507.02592 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.403241Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:ec806e2b300e2e1119c0738f0a23b47dadfd8dc03be5aaa3cdd3963f1f72db1c","observation_id":"88dfc456-8fce-4535-9a97-876e6a2a419d","resolution":{"observed_at":"2026-08-05T04:44:29.403241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15061","last_updated":"2025-07-20T17:53:37Z","snapshot_observed_at":"2026-08-13T13:17:03.431364Z","submitted_at":"2025-07-20T17:53:37Z","title":"WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15061","snapshot_observed_at":"2026-08-05T04:44:29.547768Z","title":"arXiv preprint arXiv:2507.15061 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.547768Z"},"links":{"cited_paper":"/paper/2507.15061","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:b2585aff6d4658a738372c07156ff458e26723b214694e4c73c3694c9505c1af","observation_id":"a40ec824-5d1b-417f-b688-9dec1a1b28c4","resolution":{"observed_at":"2026-08-05T04:44:29.547768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:29.646003Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.646003Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:551cb61f625fe9f75231807b4e77592ec45d2548cba8636ac72f069157f88d1a","observation_id":"5372b521-88d0-4cdf-94c5-6ad3f667ed21","resolution":{"observed_at":"2026-08-05T04:44:29.646003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:29.746477Z","title":"IEEE transactions on pattern analysis and machine intelligence , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.746477Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:e7cc40f8a0d5b3ca6bb403ccd6945af0b54a5b912ce82535600a4d367c9f5c1c","observation_id":"a7cce302-aee3-40b2-ac08-93fdff9de299","resolution":{"observed_at":"2026-08-05T04:44:29.746477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-13T12:39:09.859466Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-05T04:44:29.820822Z","title":"arXiv preprint arXiv:2302.11713 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.820822Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:0ff908b2ee21ebb6af5862693bc5535ebef35a84de7f416414b0fe07bde5cb94","observation_id":"5bf954f1-ee33-40a1-9b60-d5801e39a2c0","resolution":{"observed_at":"2026-08-05T04:44:29.820822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T04:44:29.935629Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:29.935629Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:c4717145f898543611175c941cb8428555f238370b55e1be79fcd16b2a42bbb0","observation_id":"0cc449e3-67e1-4360-a6be-bf242213d6d8","resolution":{"observed_at":"2026-08-05T04:44:29.935629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T04:44:30.041611Z","title":"arXiv e-prints , keywords =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.041611Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:a835b95ede63c48d6c3b444ffb79ec3f0d1b36627d3c92369f18b87a2390c0d0","observation_id":"52cf3f54-6486-4036-8185-8ffa131cf1a7","resolution":{"observed_at":"2026-08-05T04:44:30.041611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:35.777232Z","title":"Proceedings of the 2024 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":"b55d04c2-5ff7-499c-88d5-18c3f026fc88","year":2024},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.150386Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:889cb37388540c78728a5f501ba1e58bebc12b7e7ed702aefca76ef4890efdd2","observation_id":"75e65da6-332f-40f3-9a91-415fc5092505","resolution":{"observed_at":"2026-08-05T04:44:35.881911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:30.255721Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.255721Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:673ec10563996201377fddba91cb2950c22d5df2af5b9b5a721889e062aee560","observation_id":"f174c949-a9a0-4d90-a449-9bd883251944","resolution":{"observed_at":"2026-08-05T04:44:30.255721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-05T04:44:30.356821Z","title":"arXiv preprint arXiv:2410.02713 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.356821Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:9822117596bfd5911b9b1708716d845d97cbb712fc2881561d3e93976a12ef82","observation_id":"d2bc9930-dabe-4aae-ae8f-ac747acc8859","resolution":{"observed_at":"2026-08-05T04:44:30.356821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-08-12T14:21:45.818304Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20785","snapshot_observed_at":"2026-08-05T04:44:30.446320Z","title":"thinking with long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.446320Z"},"links":{"cited_paper":"/paper/2511.20785","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:3415c6681f5017951e44e70ceeb2c98847a022aa3a7dec2ae4c7c87083746c80","observation_id":"fba83264-40dc-4253-a0ee-d9b25e798be5","resolution":{"observed_at":"2026-08-05T04:44:30.446320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-08-09T07:51:37.523530Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04416","snapshot_observed_at":"2026-08-05T04:44:30.525201Z","title":"arXiv preprint arXiv:2508.04416 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.525201Z"},"links":{"cited_paper":"/paper/2508.04416","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:1389d724f74374e31e9306223567493de80f2d85f4047d8407538488aed24fa9","observation_id":"b943b3f8-bd6f-475f-b17a-530aae2b75e3","resolution":{"observed_at":"2026-08-05T04:44:30.525201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-05T04:44:30.600425Z","title":"arXiv preprint arXiv:2506.13654 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.600425Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:e9dc579e2fa168e0275efb66370bd06f3ba5a1897592de0cb516a77bc65501c3","observation_id":"2c336cee-0198-4967-87ef-4c11cc1ca7a0","resolution":{"observed_at":"2026-08-05T04:44:30.600425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.14870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:33.425883Z","title":"arXiv preprint arXiv:2512.14870 , year=","venue":null,"work_id":"ee5e4a4a-a9c3-4d29-8c34-3715c628f20a","year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.684319Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:1b37e6e7926543fed432ee5728a0622830cedb5533618ecccd5d225fcfc330bf","observation_id":"58f20515-b1ce-457b-a62e-9552faccfd82","resolution":{"observed_at":"2026-08-05T04:44:33.476174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:35.589681Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"a7a0c895-5187-458e-9ad2-b6c368192a35","year":2025},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.761599Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:97782a62a2ad4fc89125e9111f123bb2b5e8a4bfada6beffb58c14fafc3d4211","observation_id":"d2f5b0b7-75a7-4c28-89ae-467e4091ebeb","resolution":{"observed_at":"2026-08-05T04:44:35.651100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:30.866744Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.866744Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:7124013a21509f21ab383faf4c7e9f389403fab20b6ba13074ec22ab087909bb","observation_id":"c648c6b9-d2b0-44d3-a52c-d7e55d67019e","resolution":{"observed_at":"2026-08-05T04:44:30.866744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:30.939009Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.939009Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:19f7dc8f5ba3c8b5d1c14cda4bb336831c2709178897e7a186861d734045739b","observation_id":"5a1213c8-f9e5-4a53-9fa0-98921ecad209","resolution":{"observed_at":"2026-08-05T04:44:30.939009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:31.001168Z","title":"arXiv preprint arXiv:2603.19217 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.001168Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:98a0d1200966ad16ce56bdd0700f51af09f01a4eb533f0e84e3a7f24ee45e7a2","observation_id":"c3e4ad40-9018-4eea-9bcb-d36c6c3cc83a","resolution":{"observed_at":"2026-08-05T04:44:31.001168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:31.067191Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.067191Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:71743c5d0dbc3c0844f355b8825517d3bb14b60e04ac38ca39f1c193e27d3938","observation_id":"164e7250-c2f0-4bca-8069-fbb09c9e92a2","resolution":{"observed_at":"2026-08-05T04:44:31.067191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:31.184609Z","title":"arXiv preprint arXiv:2510.10689 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.184609Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:6d50b541b6ab6d285b95f12d1d5089e06b945d9ac209195798484326d4092b09","observation_id":"3983520e-04dc-436f-a665-faa8d643b5f2","resolution":{"observed_at":"2026-08-05T04:44:31.184609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14145","last_updated":"2026-06-20T06:06:01Z","snapshot_observed_at":"2026-08-06T03:38:50.897522Z","submitted_at":"2026-03-14T22:28:38Z","title":"MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14145","snapshot_observed_at":"2026-08-05T04:44:31.241489Z","title":"arXiv preprint arXiv:2603.14145 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.241489Z"},"links":{"cited_paper":"/paper/2603.14145","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:0f6af326eda45707c213773a020fb19fec5c6192088997712795fdfcad78e5d3","observation_id":"16bdf053-cf44-4b4f-9257-a8077c613024","resolution":{"observed_at":"2026-08-05T04:44:31.241489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:35.384927Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"ad79b0a0-265e-44f8-ac03-6cd1af61e8e7","year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.286651Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:0e313b6f536de779cf4f87a3c2db36617764be32950dd02bacc0ea7486c73c6a","observation_id":"ded02916-e121-45fd-940a-b0ac7d8bd37d","resolution":{"observed_at":"2026-08-05T04:44:35.465510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-13T14:51:05.772020Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-08-05T04:44:31.371937Z","title":"arXiv preprint arXiv:2505.21374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.371937Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:922fd11dde80514bce049654a6f0bbe0b588030fc8bb49db4e63cb78a424925a","observation_id":"7458f876-fe13-4bb4-995b-6e8cfd35982f","resolution":{"observed_at":"2026-08-05T04:44:31.371937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:31.444260Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.444260Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:1773721d0997ab2215a2d91b542b53391ed592d0d5f03f64858485d9692f21f6","observation_id":"62a1bb0c-ce06-41eb-a7e1-6a210e69a66e","resolution":{"observed_at":"2026-08-05T04:44:31.444260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T04:44:31.521258Z","title":"arXiv preprint arXiv:2501.13826 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.521258Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:31b345189978339e3faf04d36c073027f5bd894cc58efe42f30c2c49d8b04cb8","observation_id":"fd6709aa-23b5-4ed4-8d69-c5906b3ea488","resolution":{"observed_at":"2026-08-05T04:44:31.521258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:35.203920Z","title":"and Han, Rilyn and Fei-Fei, Li and Xie, Saining , title =","venue":null,"work_id":"8aec531e-add8-453f-aea2-2d7651718c89","year":2025},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.597799Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:0b5db8e6f9c52e3bded0bddfecd71b7e54d7bcf317b32c6521cd05a86070bcd5","observation_id":"6b64bbf6-ff09-462c-9140-ce71861d595f","resolution":{"observed_at":"2026-08-05T04:44:35.297932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:35.012962Z","title":"2026 , eprint=","venue":null,"work_id":"cc17942b-e7e3-4353-b8ab-1934fa43c8f5","year":2026},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.649344Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:a5b177e64a2c8a0c5b3e897dd7fdfa2078bcf9558500ba7af1af6b8a4bf442c5","observation_id":"ddfc1082-a5f5-4cf3-8aae-e386e27d7e0c","resolution":{"observed_at":"2026-08-05T04:44:35.120998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:34.822746Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"cef69469-35b4-443d-8a03-5f31139e534f","year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.727354Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:de4fe14928b783be4c3e9987b0f96af3bef1428164efda942c3656472531b520","observation_id":"60e642cf-e2e9-49b2-a522-ff4045044394","resolution":{"observed_at":"2026-08-05T04:44:34.922307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T04:44:31.811427Z","title":"arXiv preprint arXiv:2112.09332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.811427Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:94a8c261815274d05f4a9d657e7440a63a694b110710cafbf74750956f2869da","observation_id":"c62a29f0-cc7a-4563-8e9a-40e7fbf97594","resolution":{"observed_at":"2026-08-05T04:44:31.811427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02224","last_updated":"2023-06-04T01:07:20Z","snapshot_observed_at":"2026-08-13T11:25:02.500121Z","submitted_at":"2023-06-04T01:07:20Z","title":"Auto-GPT for Online Decision Making: Benchmarks and Additional Opinions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02224","snapshot_observed_at":"2026-08-05T04:44:31.890534Z","title":"arXiv preprint arXiv:2306.02224 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.890534Z"},"links":{"cited_paper":"/paper/2306.02224","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:9661962349ff7083f5cefecf3f488b3ed4145e2faaa34466335b8bb754fd71ef","observation_id":"9a4b58f0-e5f0-49c6-8756-72d8140e0c8e","resolution":{"observed_at":"2026-08-05T04:44:31.890534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05185","last_updated":"2026-05-06T17:50:38Z","snapshot_observed_at":"2026-08-02T12:07:09.741466Z","submitted_at":"2026-05-06T17:50:38Z","title":"OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05185","snapshot_observed_at":"2026-08-05T04:44:31.997680Z","title":"arXiv preprint arXiv:2605.05185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:31.997680Z"},"links":{"cited_paper":"/paper/2605.05185","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:23cce62c57879ca3e373be9968bcf0b5b4331314663cf5618632c77a497e2e1c","observation_id":"aa25b629-98da-4b97-908c-a78538470cb3","resolution":{"observed_at":"2026-08-05T04:44:31.997680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:32.078052Z","title":"arXiv preprint arXiv:2602.14234 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:32.078052Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:ac490f1044d93bdcd451049705427f2cd5dee0cd33f165e973bc92d6463877c6","observation_id":"694c7a00-1928-4c6c-b21c-cf47442a0eeb","resolution":{"observed_at":"2026-08-05T04:44:32.078052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:32.134345Z","title":"arXiv preprint arXiv:2509.25027 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:32.134345Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:cf57962b697486f74a319ccfcadfc149a3f1c52de303e1136c732b0e8661d492","observation_id":"d773791b-43ce-4c1a-b8c8-42b5bfb8a1c2","resolution":{"observed_at":"2026-08-05T04:44:32.134345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28767","snapshot_observed_at":"2026-08-05T04:44:32.205411Z","title":"arXiv preprint arXiv:2603.28767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:32.205411Z"},"links":{"cited_paper":"/paper/2603.28767","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:0db5081c465fd417a42ade5a182ba654f70f0678ec6e1ee8afe7e92cfffb99c1","observation_id":"731cdedc-1297-4081-8a5a-4d7d4122a14a","resolution":{"observed_at":"2026-08-05T04:44:32.205411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T04:44:32.269924Z","title":"5: Visual Agentic Intelligence , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:32.269924Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:e995b24aadf0cb960f534ab6734f40b89552250ec5bba910f12d8bc0d644260c","observation_id":"9a810b8e-ed71-4deb-9371-cac9960f024d","resolution":{"observed_at":"2026-08-05T04:44:32.269924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T04:44:32.384273Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:32.384273Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:e3d8dd02083e854153c6edc12861dc79e563d9e2ef4e63f02a6e3bb547850c99","observation_id":"b1f64d43-be90-44d5-8b2c-8f0dd8dd4960","resolution":{"observed_at":"2026-08-05T04:44:32.384273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:44:32.473958Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:32.473958Z"},"links":{"citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:3bc25b455a4a78901d5bfc2a8b99f3d74112053bdc5ee1a24fcbf43af87fa63d","observation_id":"4bfe723a-b2cb-4c3d-87be-94251c02948e","resolution":{"observed_at":"2026-08-05T04:44:32.473958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T14:05:00.511715Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2608.03979."}