{"as_of":"2026-08-05T06:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a44c393a92732190399fadfeba1047b0b099a7753565e6fbe0679176b9f60987","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:02:35.739213Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.10809/citation-record","integrity":"/paper/2602.10809/integrity","json":"/paper/2602.10809/citation-record.json","paper":"/paper/2602.10809"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:32.481330Z","title":"Introducing claude opus 4.5, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.481330Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:1b209a158ac9f8ffc010580b68bccc8e7adbef33d45b89e1c7986428bed5bdeb","observation_id":"e703c280-ad41-4414-b796-56356ad3d700","resolution":{"observed_at":"2026-08-03T01:02:32.481330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:32.519876Z","title":"Introducing claude sonnet 4.5, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.519876Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:0f8368d0be672ab038fb4aab8d1fee58bea1e2e6408f90cb68070dafd8ed42ce","observation_id":"0c3cd124-f102-4b22-b40c-74306fe7aab0","resolution":{"observed_at":"2026-08-03T01:02:32.519876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T01:02:32.574737Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.574737Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:70417c438d0fffa1a9dc223cc525643d09021cb52199997722c88883739616c3","observation_id":"b349e52a-5994-4ac3-97de-6beed00b7849","resolution":{"observed_at":"2026-08-03T01:02:32.574737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:32.635539Z","title":"Seed1.6-embedding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.635539Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:68e93bcb655b60bbf2acc6333451c1ecd550bd00bd858c208204fdfd442b47b1","observation_id":"6e93fd0d-42b5-4259-bd2b-04f63bc3beaf","resolution":{"observed_at":"2026-08-03T01:02:32.635539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-07-06T21:49:13.509342Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-08-03T01:02:32.688658Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.688658Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:4029b174796ef0a6d5b7d2e5dd968ad93bbd102d9bf89a797e9bd946c7bf5f5f","observation_id":"12d175b6-6b6f-42b9-9584-86eab0bb3b58","resolution":{"observed_at":"2026-08-03T01:02:32.688658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:32.750201Z","title":"mme5: Improving multimodal multilingual embeddings via high-quality synthetic data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.750201Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:18ade8410df6ee08f80bd9f6076a4f441969a1a370a52d46981e92a9f12ee169","observation_id":"bf2732b4-67c7-4f6a-95c7-0b56b7d21034","resolution":{"observed_at":"2026-08-03T01:02:32.750201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:32.802191Z","title":"Generative thinking, corrective action: User-friendly composed image retrieval via automatic multi-agent collaboration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.802191Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:79b8d0ce96eae3ff1463cdaf54c7ae243a087f02548b99f939b473e56baf5711","observation_id":"3526ed00-8740-452d-a0e9-f03ea2bb870b","resolution":{"observed_at":"2026-08-03T01:02:32.802191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11858","last_updated":"2025-04-11T04:26:42Z","snapshot_observed_at":"2026-07-06T20:23:40.374376Z","submitted_at":"2025-01-21T03:22:10Z","title":"EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11858","snapshot_observed_at":"2026-08-03T01:02:32.859526Z","title":"Embodiedeval: Evaluate multimodal llms as embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.859526Z"},"links":{"cited_paper":"/paper/2501.11858","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:b6dfab4114912915531bfd8b41d60ebab34ccb4cffe5ed618235fae64f6955f6","observation_id":"fdce8250-ad50-4153-8923-823f3152cbf8","resolution":{"observed_at":"2026-08-03T01:02:32.859526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:32.925071Z","title":"N., Awasthi, A., Pan, X., Ahuja, C., Mishra, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:32.925071Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:7e0dff75c7c5e815b67204581c2a7b0b4aa73d0c84fc260fcf7241cfe055ecc5","observation_id":"445417bb-7f86-409f-ba75-5d3366f6297d","resolution":{"observed_at":"2026-08-03T01:02:32.925071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:33.014774Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.014774Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:b7f691cc40cde39a1f092b5264eb3e0b5e45ddc94d57115502d3e79d2c628eae","observation_id":"83553ad4-7500-4cc2-b70d-d83a80b48ce5","resolution":{"observed_at":"2026-08-03T01:02:33.014774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:33.072098Z","title":"Colpali: Efficient document retrieval with vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.072098Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:6e97c1789327a8545bd24db96deb00e71f3d800a1b4ce995905ed5c212b0f203","observation_id":"1a166859-1437-4990-b6e9-a382c3b0fc2b","resolution":{"observed_at":"2026-08-03T01:02:33.072098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:33.158432Z","title":"A new era of intelligence with Gemini 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.158432Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:0e554b4ede41ca401bf3f5ff3b1058f8e7727a9794e235f550afe65af450d48d","observation_id":"1fe1adda-0ff8-4ee8-810d-001bc1a4585f","resolution":{"observed_at":"2026-08-03T01:02:33.158432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21506","last_updated":"2025-07-03T15:47:40Z","snapshot_observed_at":"2026-07-06T21:48:12.113972Z","submitted_at":"2025-06-26T17:32:50Z","title":"Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21506","snapshot_observed_at":"2026-08-03T01:02:33.277823Z","title":"J., Shu, Y., Song, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.277823Z"},"links":{"cited_paper":"/paper/2506.21506","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:ab1c7113c5ce10b966904fd80731c0331b96d5e553f6684881a21ac3e5c1c460","observation_id":"20dd5299-2df9-4aa2-b4a3-347238f418c1","resolution":{"observed_at":"2026-08-03T01:02:33.277823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T01:02:33.394995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.394995Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:aaf8c8e142cbd5a43e979277e6e4410e8505a1880eee3e24f0d3b6c1121ef2d0","observation_id":"02532e51-fb6a-4e92-8739-f284b0ef4f0b","resolution":{"observed_at":"2026-08-03T01:02:33.394995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:33.487414Z","title":"V., Sung, Y., Li, Z., and Duerig, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.487414Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:25faaeb25135689ab30e794f3522f7977eeb4b1ecd8a84b1e3e18f06798be2c3","observation_id":"9f24c0db-43fc-4f5d-bd7b-a6602f470807","resolution":{"observed_at":"2026-08-03T01:02:33.487414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:33.605943Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.605943Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:662d3500202aa6ca4c6265920f3bc5d2a4e2ee91f63a1d7b76a61f41c65929f0","observation_id":"31d3e9fd-d003-4240-b176-73b5528a99b8","resolution":{"observed_at":"2026-08-03T01:02:33.605943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:33.698727Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.698727Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:e91b18c4ed8441ea69852b98076bcde4256ee7df4269c8403bb881229502ffd9","observation_id":"cc69d2e7-97ed-4dad-90db-293002dc2100","resolution":{"observed_at":"2026-08-03T01:02:33.698727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:33.818381Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.818381Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:c1173b628ac3d9037f8b27865f6a494f20822fd23aa6a7cc56e69b2b43976c99","observation_id":"15aa4e4e-bea2-4fb9-bdb9-a3d9b3927088","resolution":{"observed_at":"2026-08-03T01:02:33.818381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-08-03T01:02:33.914474Z","title":"Qwen3-vl-embedding and qwen3-vl-reranker: A unified framework for state-of-the-art multimodal retrieval and ranking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:33.914474Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:e784d5ebcd39643b9bf20248e6e348c07a47f8ab5233a7e6965f453e876fcb01","observation_id":"7ded2419-e48c-4485-958d-a9b5d6c385d7","resolution":{"observed_at":"2026-08-03T01:02:33.914474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-07-06T22:14:35.142771Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-08-03T01:02:34.091340Z","title":"Mm-browsecomp: A comprehensive benchmark for multimodal browsing agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.091340Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:dc631bc030aee5ae6c99582bab9ee13707d9982d255eaa237048dae79838ef95","observation_id":"32b42022-5d2f-4b8e-9ab1-c7de86b259c1","resolution":{"observed_at":"2026-08-03T01:02:34.091340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:34.230034Z","title":"Mm-embed: Universal multimodal retrieval with multimodal LLMS","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.230034Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:c3079153d55435cb57475994cf0c7e0e4adf33820a216e979c455b617c38a0db","observation_id":"38ffbf4b-2e8d-4ba8-ae1a-df91b7c7e20e","resolution":{"observed_at":"2026-08-03T01:02:34.230034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04590","last_updated":"2025-07-07T00:51:57Z","snapshot_observed_at":"2026-08-02T08:05:44.477432Z","submitted_at":"2025-07-07T00:51:57Z","title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04590","snapshot_observed_at":"2026-08-03T01:02:34.320848Z","title":"Vlm2vec-v2: Advancing multimodal embedding for videos, images, and visual documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.320848Z"},"links":{"cited_paper":"/paper/2507.04590","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:b567b9480d27e951cd7e59d6dcddfb4b56282b99227aaefe766d93e3c6e0f793","observation_id":"16166113-7826-420e-87a1-7f1c84adfb6b","resolution":{"observed_at":"2026-08-03T01:02:34.320848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:34.417790Z","title":"Introducing GPT-5.2 : The most advanced frontier model for professional work and longrunning agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.417790Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:46ed2391fecafd9143c94a8c6b9b99bbf7655c6dff647005192b0e6890f8e004","observation_id":"1ac97c6c-3015-4164-ae98-6d82a0434c9c","resolution":{"observed_at":"2026-08-03T01:02:34.417790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:34.591875Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.591875Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:84c2a52abed914bb0d9b22b82377c7f065f166aaf4cc5da29a0f6522b3826bd1","observation_id":"d1f48c7d-b670-41b2-9661-828190fdb8db","resolution":{"observed_at":"2026-08-03T01:02:34.591875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:34.769100Z","title":"Glm-4.5v and glm-4.1v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.769100Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:3ad4a92c046a9338d498efc5a441011a443c9f628688e3383bafbc3018e93632","observation_id":"0b387237-72f7-43ce-87b4-bb5e9b8e8374","resolution":{"observed_at":"2026-08-03T01:02:34.769100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:34.951741Z","title":"A., Friedland, G., Elizalde, B., Ni, K., Poland, D., Borth, D., and Li, L","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.951741Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:0ba80067a12c669e0c7918872f15f70167573f2b7d764ddb522175c8786f4fcf","observation_id":"36d67bfd-7b05-455f-8669-7ddc259737ba","resolution":{"observed_at":"2026-08-03T01:02:34.951741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19952","last_updated":"2025-05-26T13:17:50Z","snapshot_observed_at":"2026-07-06T21:30:37.657153Z","submitted_at":"2025-05-26T13:17:50Z","title":"Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19952","snapshot_observed_at":"2026-08-03T01:02:35.070287Z","title":"Multimodal reasoning agent for zero-shot composed image retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.070287Z"},"links":{"cited_paper":"/paper/2505.19952","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:2358a1dad6ab3f46cb338c852847ac2aa1e83f06cf65683d415b04b22b84cf83","observation_id":"9b1c5e39-0d5b-436d-98fc-ec0b8f51f774","resolution":{"observed_at":"2026-08-03T01:02:35.070287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.158045Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.158045Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:48a3ac01023064ac5b92ca77765531e3c34817cf0faedc41ed203d7760382879","observation_id":"ef29b82e-b6f1-423d-ab3d-17a186663cef","resolution":{"observed_at":"2026-08-03T01:02:35.158045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.250679Z","title":"J., Cheng, Z., Shin, D., Lei, F., Liu, Y., Xu, Y., Zhou, S., Savarese, S., Xiong, C., Zhong, V., and Yu, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.250679Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:fa015b6bf8e586dc5ae97191410ac78b070ed261b595640a776dfb2c5af06cff","observation_id":"9fe77158-cac5-4238-a4e8-22e0d2f817b1","resolution":{"observed_at":"2026-08-03T01:02:35.250679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.310474Z","title":"A survey on agentic multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.310474Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:a0b1c3aba1b846d3ecd95ec3fc67a5c02f82869e9c4d82df16b50626adefd948","observation_id":"cc4dfd74-5688-4ac3-9319-be2578710aad","resolution":{"observed_at":"2026-08-03T01:02:35.310474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-03T01:02:35.381687Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.381687Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:ccceffa7a478e69de05f2dec17ae08482e4d85d0c5ee573393c63c186e0410cd","observation_id":"980d3209-a6fa-4191-80b3-f613ddd9f0b7","resolution":{"observed_at":"2026-08-03T01:02:35.381687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.441433Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.441433Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:8fb03a74474200a17eebde49307ec5321d0dff4a24678c240f45710599305ff4","observation_id":"49d1665b-b035-4f00-a2a9-87125fc03ff8","resolution":{"observed_at":"2026-08-03T01:02:35.441433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.493635Z","title":"Magiclens: Self-supervised image retrieval with open-ended instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.493635Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:524ba6c617940adb879295facea4d6953568c1dde73672bea34dce705c530938","observation_id":"6b10a885-a4ba-4dfb-95e3-06b3ed909129","resolution":{"observed_at":"2026-08-03T01:02:35.493635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-03T01:02:35.562855Z","title":"GME: improving universal multimodal retrieval by multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.562855Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:7225e7474b1ece3bcea795e2a5fa09d6d477802c7c18531f503255ee7de4d361","observation_id":"e00c3eb1-e0f5-4c09-8fb1-7a4805c5d85b","resolution":{"observed_at":"2026-08-03T01:02:35.562855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06148","last_updated":"2026-04-24T03:56:57Z","snapshot_observed_at":"2026-07-06T21:06:12.984419Z","submitted_at":"2025-04-08T15:43:01Z","title":"V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06148","snapshot_observed_at":"2026-08-03T01:02:35.623295Z","title":"J., Yan, R., Yao, Y., and Wang, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.623295Z"},"links":{"cited_paper":"/paper/2504.06148","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:fdaff5e1c8026f3abc7be68927f1f727d83823d9ec4076e29ba6dba027f4c19b","observation_id":"3b411d52-5745-4bfb-862b-b6cb155c6133","resolution":{"observed_at":"2026-08-03T01:02:35.623295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.692722Z","title":"J., and Lian, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.692722Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:b390ef65473da4dcd62f7ad162c9c0719eb8d0cb72d962d493caacb54612004f","observation_id":"8ef789e4-2270-4b6f-a5bc-0b33acecb204","resolution":{"observed_at":"2026-08-03T01:02:35.692722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.733752Z","title":"F., Zhu, H., Zhou, X., Lo, R., Sridhar, A., Cheng, X., Ou, T., Bisk, Y., Fried, D., Alon, U., and Neubig, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.733752Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:32e875bc6fef00aee6fd950aca5aa3738f2f7c6220a51731e1749708732ffec1","observation_id":"2ac36528-f433-4fc8-b53f-0c0e46b615e9","resolution":{"observed_at":"2026-08-03T01:02:35.733752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.736324Z","title":"Large language models for information retrieval: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.736324Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:c4d59b9d52f4c1979b3fd3f38bb83d8886cc5975926f4739f57e83a482c9007c","observation_id":"5b43014d-2eb1-4f58-95f2-60bce1e64fa0","resolution":{"observed_at":"2026-08-03T01:02:35.736324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:02:35.739213Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:35.739213Z"},"links":{"citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:986951a420e5ef304e45f505ec647c92794caadd877efdc80cb382d814edd8bd","observation_id":"933a7374-a2f8-4049-b55b-4cb929bf10af","resolution":{"observed_at":"2026-08-03T01:02:35.739213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T10:40:25.806603Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2602.10809."}