{"as_of":"2026-08-08T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6094abcad0458f54d7e53252eec7a3acfad7594dc15257b786b103a887626d37","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:18:59.692988Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T15:38:30.195236Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-08-03T01:02:34.091340Z","title":"Mm-browsecomp: A comprehensive benchmark for multimodal browsing agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10809","last_updated":"2026-05-29T06:07:43Z","snapshot_observed_at":"2026-08-08T07:23:55.696942Z","submitted_at":"2026-02-11T12:51:10Z","title":"DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:34.091340Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2602.10809"},"observation_digest":"sha256:17afaf3caa13570d62d7c27fa0a65a61caa74f55f7d00362b98b9225d9bbb15c","observation_id":"32b42022-5d2f-4b8e-9ab1-c7de86b259c1","resolution":{"observed_at":"2026-08-03T01:02:34.091340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T07:44:02.827006Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2603.20633"},"observation_digest":"sha256:027ba68ba6ad21a4da97d3b264198a2e14f39dd7ab7244eeed2168996bef6cc5","observation_id":"7dfbe0e6-6255-4e38-91fa-5e5068751497","resolution":{"observed_at":"2026-05-15T07:45:14.386566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2604.04017","last_updated":"2026-04-05T08:29:52Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T08:29:52Z","title":"GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T17:31:08.575993Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2604.04017"},"observation_digest":"sha256:c2e84bcd5a1468d9e76e8a3f65d641232051a61400bbb0c952fe5d5f94c5a201","observation_id":"955b1706-b724-4971-8419-1b77a9eecc59","resolution":{"observed_at":"2026-05-13T17:33:02.334719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2604.12890","last_updated":"2026-04-25T02:32:57Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T15:40:28Z","title":"Towards Long-horizon Agentic Multimodal Search","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:40:32.137708Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2604.12890"},"observation_digest":"sha256:458cb0254c93355375244d6303f44cc1bb6cdca261ba1fb50d197fc2172a1d4a","observation_id":"10cde9e7-b8a9-465c-988c-8ce1043ce649","resolution":{"observed_at":"2026-05-11T10:01:04.548823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2604.14448","last_updated":"2026-04-15T21:54:27Z","snapshot_observed_at":"2026-07-06T23:02:13.885476Z","submitted_at":"2026-04-15T21:54:27Z","title":"MARCA: A Checklist-Based Benchmark for Multilingual Web Search","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T12:54:27.110593Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2604.14448"},"observation_digest":"sha256:2e6d8b6ea0c7835fcc7198d12b0817d5646d6c9a9b4b9203ec7880af99a9adfa","observation_id":"c577a077-2d56-4d06-b41b-be1626d4fef4","resolution":{"observed_at":"2026-05-10T12:55:24.292789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.10832","last_updated":"2026-06-05T07:49:38Z","snapshot_observed_at":"2026-07-31T06:36:29.123202Z","submitted_at":"2026-05-11T16:49:36Z","title":"Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:15:40.042348Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.10832"},"observation_digest":"sha256:be8dca9817df6ef48532fb0a7304f0daf9c7953b3b897e34b26284405d93f6ea","observation_id":"1b1ad998-ae3b-4b90-a74c-345572e497d9","resolution":{"observed_at":"2026-05-12T06:26:26.286747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.10832","last_updated":"2026-06-05T07:49:38Z","snapshot_observed_at":"2026-07-31T06:36:29.123202Z","submitted_at":"2026-05-11T16:49:36Z","title":"Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T22:30:28.649803Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.10832"},"observation_digest":"sha256:eb28a3be155eb63ec0c4c54726c182670e3aa711121e06e3a80b71bf4ab491a8","observation_id":"e7561edf-ca1c-41ae-828f-3455364bcdd8","resolution":{"observed_at":"2026-07-01T13:55:46.331622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.12481","last_updated":"2026-05-12T17:57:04Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:57:04Z","title":"ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T03:51:54.401200Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.12481"},"observation_digest":"sha256:f028c539132efd4d91b9c6690b1955bd23fbc28406bcbb9b715115ef09bc99ef","observation_id":"18eaf2f7-a8a9-4fb7-8da1-8cf1fd751645","resolution":{"observed_at":"2026-05-13T03:52:12.448979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.17946","last_updated":"2026-05-20T03:33:36Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:03:48Z","title":"SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-20T10:08:56.397296Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.17946"},"observation_digest":"sha256:54f8c5c4fdd1da0eae6cb5d80bfac838b59439e856986f1e2195a3af4751017f","observation_id":"ea77197f-3f7e-49f3-b743-2f77a2caa3a7","resolution":{"observed_at":"2026-05-20T10:13:11.959110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2605.17946","last_updated":"2026-05-20T03:33:36Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:03:48Z","title":"SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-21T08:49:32.503461Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2605.17946"},"observation_digest":"sha256:939dff22d36825e1ccb98c13286fd1f3711102c54491026aff3edee7736183d5","observation_id":"239f26a6-f098-474f-9899-abcb96895546","resolution":{"observed_at":"2026-05-21T08:49:53.430701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2606.07689","last_updated":"2026-06-05T06:25:11Z","snapshot_observed_at":"2026-07-06T23:47:19.773490Z","submitted_at":"2026-06-05T06:25:11Z","title":"Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T22:20:53.187362Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2606.07689"},"observation_digest":"sha256:878dfe1b2789e193558b544a57c8d006a1a27210eca07c8762610202035620ff","observation_id":"9a2dc7dd-27e7-4ec9-97a4-ebf9e7aa6f19","resolution":{"observed_at":"2026-07-02T16:47:10.205636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2606.10460","last_updated":"2026-06-09T06:15:36Z","snapshot_observed_at":"2026-08-04T18:36:56.607455Z","submitted_at":"2026-06-09T06:15:36Z","title":"LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T13:41:35.986601Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2606.10460"},"observation_digest":"sha256:a87d9ef9e7a01533fca91a8c4ad29f93d5e4e29617d5dc21a208dce6d4e86b5c","observation_id":"d01175b6-838b-4025-aef4-bad8c086cc24","resolution":{"observed_at":"2026-07-03T04:47:37.848395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":"2508.13186","doi":"10.48550/arxiv.2508.13186","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":"21706164-8e74-4407-bd00-78bd4f7a296d","year":2025},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-03T15:00:12.134373Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:752e61f9d5c85cc333d2eba3eeb4e4ce0ac94449f7613016702fa4bb3da969dd","observation_id":"dbc08aa0-a0ca-4afc-8b18-4b3beb0f6fd1","resolution":{"observed_at":"2026-07-02T19:07:17.131815Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-07-14T10:51:16.019022Z","title":"arXiv preprint arXiv:2508.13186 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10557","last_updated":"2026-07-12T04:13:27Z","snapshot_observed_at":"2026-08-07T19:26:40.944900Z","submitted_at":"2026-07-12T04:13:27Z","title":"UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-14T10:51:16.019022Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2607.10557"},"observation_digest":"sha256:655aeb646cadbd0b5389b315d423de6dcfaef478984f66679606b89e61630cdd","observation_id":"0605d5af-1a04-4902-8244-c00b060f8450","resolution":{"observed_at":"2026-07-14T10:51:16.019022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13186","snapshot_observed_at":"2026-08-03T15:38:30.195236Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29002","last_updated":"2026-07-31T04:00:15Z","snapshot_observed_at":"2026-08-08T13:54:24.570258Z","submitted_at":"2026-07-31T04:00:15Z","title":"MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T15:38:30.195236Z"},"links":{"cited_paper":"/paper/2508.13186","citing_paper":"/paper/2607.29002"},"observation_digest":"sha256:7a251a0047502a3969abce902ca8ef05f5c621c10764b42acb21f798db4ac5d9","observation_id":"fcdcc24d-bda5-43e1-a8af-9e8a3a4c3b6f","resolution":{"observed_at":"2026-08-03T15:38:30.195236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.13186/citation-record","integrity":"/paper/2508.13186/integrity","json":"/paper/2508.13186/citation-record.json","paper":"/paper/2508.13186"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T20:18:52.178365Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.178365Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:662efd3413f29f7915bf97294bccf7f3aad0cdbac56602eea736eb103178b183","observation_id":"c2260c22-16f8-464c-8c5e-dd2b48c0cdb8","resolution":{"observed_at":"2026-08-05T20:18:52.178365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:18:52.262125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.262125Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:b131d0dd1d4a1931040da40e7bd5d2231dbc2a497c456e7dd9744f1b2a0a8793","observation_id":"1e50ed77-ef65-4b12-a17c-d1061f95e96f","resolution":{"observed_at":"2026-08-05T20:18:52.262125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.903264Z","title":"Deepresearch bench: A comprehensive benchmark for deep research agents","venue":null,"work_id":"ed097e05-04bf-4669-94cf-aebd208486c7","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.385826Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:939a5679967fee4f1b11d7505a877902b092d719bb7176d07f46ae4da9ca754e","observation_id":"9e8ba05a-64a0-4145-ad7b-3111070f3929","resolution":{"observed_at":"2026-08-05T20:19:06.999286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.694651Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"d6012f99-34bd-4771-b3f2-2dbfe47877ed","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.509153Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:517407dab763183e1cbb653e9ad1f52dde7b1fbd0884ef1b712d76604fc30691","observation_id":"5ba2930b-e602-49d7-9146-a92bcd5e1224","resolution":{"observed_at":"2026-08-05T20:19:06.829215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.476719Z","title":"Gaia benchmark: Results public dataset, 2025","venue":null,"work_id":"70a2be96-0a41-46f6-9bd2-1fd14ceb8d78","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.642402Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:00c8da04c79e81ba1b36997fa456c32b5b10b53dc4d8393dfc990f809491157f","observation_id":"980e99a2-4868-4577-a606-dec42c95370c","resolution":{"observed_at":"2026-08-05T20:19:06.549216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.367256Z","title":"Gemini Deep Research","venue":null,"work_id":"45119c15-57a8-4d41-8d10-6e06ab2093ce","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.749398Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:614653fa644b5537ff9d8a3142f97402cca96df86b6a60925de4090195d252b6","observation_id":"2e70f5e7-7a54-40c2-919c-0a7e20d36870","resolution":{"observed_at":"2026-08-05T20:19:06.408320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:06.188663Z","title":"Gemini 2.5","venue":null,"work_id":"42a7bc3b-a6bb-40b1-b1be-a0e1db5f929e","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.870299Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:e69c632ed93f61b396cadd329a4882eeeea7d762c09f2f4b7a21e656697dff56","observation_id":"9fd53ec8-55cf-45e1-bed8-e8bbef5a76c7","resolution":{"observed_at":"2026-08-05T20:19:06.285802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:05.940767Z","title":null,"venue":null,"work_id":"42f6cc98-96b4-4955-aa9d-1a111995f5f1","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:52.987907Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:90a69d9fd6cfecf154bcf16f308c582222954e4f481c47e0c1db0a4609ad6851","observation_id":"1e3bf27e-0fd2-4775-ba3d-c37494eceeb3","resolution":{"observed_at":"2026-08-05T20:19:06.059515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-07T11:03:34.753698Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-05T20:18:53.119930Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.119930Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:7c96d38e86ef8e8b3a095bfa82ed1f8e69245d9c0d994fee82bf80be7ab07f4a","observation_id":"9db7f7ba-07db-43c4-9398-71191a188618","resolution":{"observed_at":"2026-08-05T20:18:53.119930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:05.722951Z","title":"Owl: Optimized workforce learning for general multi-agent assistance in real-world task automation","venue":null,"work_id":"f26e2953-b93e-4b65-9649-c4df8418dc58","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.219214Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:08d66065d2e012c51ed8d1c3df71aa6f08e929d96fe2d93fb1ac4f92fdaec6a7","observation_id":"3a36b098-1b49-43af-8da3-d64eeb305081","resolution":{"observed_at":"2026-08-05T20:19:05.806827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T20:18:53.300540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.300540Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:c3f821befeb5b8861c85a6636602e3a63466a69cd476f28cb6aefcdac76628e0","observation_id":"b22afdd6-2d01-456c-a6e0-9273d4e4068c","resolution":{"observed_at":"2026-08-05T20:18:53.300540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12959","last_updated":"2024-11-27T08:49:12Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:45Z","title":"MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12959","snapshot_observed_at":"2026-08-05T20:18:53.545779Z","title":"Mmsearch: Benchmarking the potential of large models as multi-modal search engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.545779Z"},"links":{"cited_paper":"/paper/2409.12959","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:2512d3902d528338e82880c3b76127c7428a1ac8d9eb8166d6cb808710d4d58a","observation_id":"48d06288-8d2f-4cc0-b863-2d85b7944321","resolution":{"observed_at":"2026-08-05T20:18:53.545779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T20:18:53.678366Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.678366Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:6971d7bfd40f2aca612ebef3307d5f211d59955c9f24e8f6214ee03666b28ab2","observation_id":"91067c32-3e30-42e4-ab33-d265c44b0950","resolution":{"observed_at":"2026-08-05T20:18:53.678366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:05.437107Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"97243ef6-063b-4885-83a1-29d8e95a1ecb","year":2014},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.814353Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:85752b1dd7de656ccc9b12554cf04fe18a53687485dbe79c08d357fc46772d0d","observation_id":"4b43a62b-5a18-4696-8cac-f3432010874d","resolution":{"observed_at":"2026-08-05T20:19:05.566008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T20:18:53.961684Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:53.961684Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:7b1a5b4683f6e542cab89bec08ab3c6cda5c410d404d20bb6e447aa318862597","observation_id":"b657d496-2232-434e-a6dd-8ad450646490","resolution":{"observed_at":"2026-08-05T20:18:53.961684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-05T20:18:54.074131Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.074131Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:02f153ec55c1b95fb8d5ff4a0a9f90e9dcb5535b090adf254125c13c184934b3","observation_id":"26a51221-4347-4ac5-88fe-8b51366e9d8b","resolution":{"observed_at":"2026-08-05T20:18:54.074131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-06T06:12:37.171726Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-08-05T20:18:54.365562Z","title":"Websailor: Navigating super-human reasoning for web agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.365562Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:5c06c0ac21841e9b9f4704272adae709510127319059738b96133e3ce7da17a1","observation_id":"47559cc3-1215-4f34-ac03-5d1916af0066","resolution":{"observed_at":"2026-08-05T20:18:54.365562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14550","last_updated":"2024-11-05T16:51:40Z","snapshot_observed_at":"2026-08-07T19:58:05.905519Z","submitted_at":"2024-06-20T17:57:51Z","title":"GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14550","snapshot_observed_at":"2026-08-05T20:18:54.512884Z","title":"Graphreader: Building graph-based agent to enhance long-context abilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.512884Z"},"links":{"cited_paper":"/paper/2406.14550","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:c5fb54af117832f3823a7f78b1e5369def570d37c1170a1731c14a402d72582d","observation_id":"3e0fe0ed-8d56-4ed1-b771-f3d637093846","resolution":{"observed_at":"2026-08-05T20:18:54.512884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-05T20:18:54.670109Z","title":"Search-o1: Agentic search-enhanced large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.670109Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:d823f84902f90c1dcdaf4438410b57cf1a33f19ca18c8e829049c2b01b5f1d9e","observation_id":"ff170901-0152-437e-83e6-f05db41890b8","resolution":{"observed_at":"2026-08-05T20:18:54.670109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18053","last_updated":"2025-06-05T16:13:05Z","snapshot_observed_at":"2026-08-07T15:59:19.638652Z","submitted_at":"2025-04-25T03:54:24Z","title":"DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.18053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.18053","snapshot_observed_at":"2026-08-05T20:19:00.210071Z","title":"DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models","venue":"cs.CL","work_id":"f589cfa6-09e0-4b9c-b494-8bb718be8269","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.813869Z"},"links":{"cited_paper":"/paper/2504.18053","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:47732ec7db513c62d2dbedf9891e92266437fbe09343dc097251c635ace1b0c5","observation_id":"701e583d-73bb-48cf-91f2-fe35ab599e05","resolution":{"observed_at":"2026-08-05T20:19:00.281226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:05.224350Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216--233","venue":null,"work_id":"6700376a-bc38-4303-b701-ccba4c855ee4","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.927315Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:275a5fb183f79fe09f86977ea8b5cd487b01ddfe9e672ae6a511071095c5f0ef","observation_id":"e8ff93a8-1712-44d8-96b0-e1e6770e55dc","resolution":{"observed_at":"2026-08-05T20:19:05.321742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T20:18:55.001509Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.001509Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a15aa418c0a977be6174ef961e24f48f33aabe628f70f6cc21214ea196c43de5","observation_id":"6ee1cf06-04b4-4a20-9ce8-0a0c47c1633a","resolution":{"observed_at":"2026-08-05T20:18:55.001509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T20:18:55.099600Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.099600Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:452f5b3c57d802015509aa26f6f271e4d8c0ea43a65d1b84de0f84c6c95db38b","observation_id":"43ca75dc-0843-4d8f-86ae-2e923ea510fd","resolution":{"observed_at":"2026-08-05T20:18:55.099600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:04.934164Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"42a485a7-b7b1-4cb7-9da7-a52a545685f9","year":2021},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.244691Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:68b38088c523ba33aaf218b686e5e17605f14e24f7cc5018ba96d7eee0dceae9","observation_id":"7a88fb56-988b-4e6e-ac07-cdb7820737d8","resolution":{"observed_at":"2026-08-05T20:19:05.036681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:18:55.347792Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.347792Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:2e85d3a4161becbba45c6fd60328870adfb8ca5cef4f78a15402d0f563c49321","observation_id":"716518fc-6e9b-404a-9976-484cfa8746a2","resolution":{"observed_at":"2026-08-05T20:18:55.347792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:04.723846Z","title":"Llama 4 Herd","venue":null,"work_id":"a62ee55e-3945-4221-9a35-5d25521c4e3f","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.456093Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:d487e578274e0c09c19dff9b4633b35cc294c0ba4301042a7865b3d55da2542e","observation_id":"d7c3e2c4-ce84-4bbc-aed6-737c9031f4a6","resolution":{"observed_at":"2026-08-05T20:19:04.820616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:18:55.620908Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.620908Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a5080329717912d02621a11d24205bc6cd31783889ed43ecfd9562c1058162cd","observation_id":"62a04ec3-a64a-444e-8858-90d99fb2b72a","resolution":{"observed_at":"2026-08-05T20:18:55.620908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:04.406333Z","title":"Microsoft Copilot","venue":null,"work_id":"45b36bfb-d1c9-497f-9695-1028012e7b44","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.821777Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:ac6ee9d186517c39cf1055f7e6312884e8bd12036de2542f203c2a953851fe95","observation_id":"130af66e-cac6-4b2d-bf13-fdc1f1deea5e","resolution":{"observed_at":"2026-08-05T20:19:04.567835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T20:18:55.993286Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:55.993286Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a4d63acddaa90a2a912e5c2b2c45ed69066485c9c00144275cc103988def2f87","observation_id":"3e5d107c-3999-4f69-9ceb-8d3e802bbe91","resolution":{"observed_at":"2026-08-05T20:18:55.993286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:04.180520Z","title":"Gpt-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":"e4a7ad88-be54-4ad5-878e-c3f33aabd7b3","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.139228Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:4bbe5ecb6a2ab8aabd87ac633fee3300e017cc4f3f7a60f6a743c9d2f02cd41a","observation_id":"fbbd6bc4-813c-4bc0-bedc-b90fc1c77007","resolution":{"observed_at":"2026-08-05T20:19:04.278759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:03.877027Z","title":null,"venue":null,"work_id":"f705d541-03a8-4e12-98d9-7ba4ebf5e5d1","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.288187Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:377d0f4e075ea74d9a8d3bbafe9716a7c63c419c7026929757c1f82f709a25b1","observation_id":"573a8663-75a4-4add-a630-b97470d60b22","resolution":{"observed_at":"2026-08-05T20:19:04.032453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:03.538966Z","title":"Introducing deep research","venue":null,"work_id":"20c247fd-5568-4f11-96a9-8e4cf87171f1","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.434664Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:5b8faf779f806294c1b2538187939d821326f17809bd062c0cbdd5253873c287","observation_id":"8b7c6f4a-def0-450a-9bd7-176c2040c44a","resolution":{"observed_at":"2026-08-05T20:19:03.667177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:03.158318Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":"5ffbcefb-fd22-490a-9a9f-6a18c8609727","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.608692Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:04e90a24d01b7de09c9b844f09792f648097298d4ebbfd5891786f87461b4f3a","observation_id":"85dbd799-a76d-441d-8898-668a038f568e","resolution":{"observed_at":"2026-08-05T20:19:03.353056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.954412Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":"bb164564-9860-4c1b-9693-a0af219446e8","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.833485Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:ede6a9ab54077f996d90e9952ad2993f0191585e5fec1b4add6f8d58a2c0d74b","observation_id":"cb0ef2da-5c1e-4578-be05-077e9497a513","resolution":{"observed_at":"2026-08-05T20:19:03.029226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:18:56.950277Z","title":"Training powerful llm agents with end-to-end reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:56.950277Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:6561bf2be3b9e75ab2c96f17ad72bfde531b25eaf9ea0baf78d3a88e5b686df2","observation_id":"d573d668-9369-4da7-b628-5b26ad2730ce","resolution":{"observed_at":"2026-08-05T20:18:56.950277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.671473Z","title":"Introducing perplexity deep research","venue":null,"work_id":"676f44b3-9707-4cb4-8639-c70617a48885","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.070228Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:3046a422531321adefb608386bf28ea546ce5d70df8a70de1df2cf4bdd97b993","observation_id":"e9453e73-4b7d-4867-9ddf-764b0cfd5338","resolution":{"observed_at":"2026-08-05T20:19:02.794314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.419698Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"76b704f1-ee73-451a-b5c0-ba73126ef98a","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.196991Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a7414c3cd0f53a85c1bcb8fc15d226d744361da2f0e89329d08b54836e0e3cdc","observation_id":"09f53ad0-7f78-4d69-a1a6-2e930e0a1bbf","resolution":{"observed_at":"2026-08-05T20:19:02.505255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.199245Z","title":"Hal: Gaia leaderboard, 2025","venue":null,"work_id":"bb4044e1-330b-48d8-9ecf-ed6e8a318cc5","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.341760Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:600f56a7b591d4aa8959bf82aaa030dd05f9e34711b0abcdfb3f43ae2f7a075f","observation_id":"ac9c6cd1-2543-42f0-9bf1-5102c3330527","resolution":{"observed_at":"2026-08-05T20:19:02.330575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:02.001985Z","title":"Humanity's last exam leaderboard, 2025","venue":null,"work_id":"5ad8ba75-14b6-4fd0-a2ab-d83dc4a2b9b6","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.480233Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:40b99f597600595329c9b35661f5a305618940d4c77d30e143fa5de9ce7d666d","observation_id":"95a63a2e-fdea-4aa9-acf2-33a40543bd8e","resolution":{"observed_at":"2026-08-05T20:19:02.110436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-05T20:18:57.605443Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.605443Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:3e47794fa87b0cdf3182369f70acd49bcd5c3ed8de91f8147258477aa94bce7c","observation_id":"59ab65c4-816a-4034-8bd3-f84843dc02e6","resolution":{"observed_at":"2026-08-05T20:18:57.605443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T20:18:57.792273Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.792273Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:64ee58ee6ad2b98d4b9982c70e3bcf9f2fa66654bd3741eefcdc3e5d8065a735","observation_id":"842b6078-8765-4205-bc5c-d899be24ff4f","resolution":{"observed_at":"2026-08-05T20:18:57.792273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:18:57.917652Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:57.917652Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:bd86d796911d02f3bd8ecc723935a6b28f1b0aab26a6fa49c7e4af55786e443f","observation_id":"95ab613e-59a0-4a92-a81f-b2e2b37fc1fa","resolution":{"observed_at":"2026-08-05T20:18:57.917652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18017","last_updated":"2025-06-03T05:34:30Z","snapshot_observed_at":"2026-08-07T17:50:42.770308Z","submitted_at":"2025-02-25T09:26:12Z","title":"ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18017","snapshot_observed_at":"2026-08-05T20:18:58.053520Z","title":"Vidorag: Visual document retrieval-augmented generation via dynamic iterative reasoning agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.053520Z"},"links":{"cited_paper":"/paper/2502.18017","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:399e17b3c7275c771b72a48d1a73995eb09bfd73d1d8d981eb78058ca545ede4","observation_id":"7b9cabd8-ade0-4f3d-860f-c9e3128ad341","resolution":{"observed_at":"2026-08-05T20:18:58.053520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T20:18:58.169572Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.169572Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:08c32db2cd918377fd5115ed1dc7f1095180dcfcfb508062b27773545b84404d","observation_id":"2cc5c784-86cf-42bb-8fe8-8a4622da8dc3","resolution":{"observed_at":"2026-08-05T20:18:58.169572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-05T20:18:58.349502Z","title":"Browsecomp: A simple yet challenging benchmark for browsing agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.349502Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:7fedc28434355c6aa987fd309620df7b365b5620009ac9404654aa88423b2380","observation_id":"9d8fe418-16a1-4b2b-930b-8e26a4138302","resolution":{"observed_at":"2026-08-05T20:18:58.349502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:01.684126Z","title":"Webdancer: Towards autonomous information seeking agency","venue":null,"work_id":"1f37a10c-7373-4bf9-8ce7-b09f9a09ddb8","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.484673Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:37af2291fd77189cca9874ee7ee8961b8de6b8b67c44ba6b27bb523da205c549","observation_id":"cd6c2255-771d-4b23-b37a-9ac36d45ea3a","resolution":{"observed_at":"2026-08-05T20:19:01.803250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-08-05T20:18:58.629661Z","title":"Mmsearch-r1: Incentivizing lmms to search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.629661Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:9d795bae61f144b1d0129e1c32879c483956f06f023e491eb50cf4c32e52082b","observation_id":"66900148-4dd5-4a78-bd8c-4b461a3f19fc","resolution":{"observed_at":"2026-08-05T20:18:58.629661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:01.445772Z","title":"Grok 3 beta — the age of reasoning agents","venue":null,"work_id":"1982df4f-b970-4077-843e-43a321c8d698","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.773879Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:21c5e1853a30585393c396ddaf994a119b874d5c015e9fb22e57c18f639de956","observation_id":"60b9b2eb-587b-4a11-aabb-82b6f0534e40","resolution":{"observed_at":"2026-08-05T20:19:01.513249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T20:18:58.951425Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.951425Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:a7a60809b2d70b740ead8ba46cf04909f492535688d22882865c0cf0c1535222","observation_id":"ba5ab07c-e2b2-4183-9397-70fd248446c0","resolution":{"observed_at":"2026-08-05T20:18:58.951425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:01.157880Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":"b6f839e4-5be0-42c2-bb50-7a140dcc4cd8","year":2022},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.075373Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:947f987e730c1d8abfbdf291e10e0ceaf662fb47820dd5606102487eade394e3","observation_id":"2c1f60de-14ea-46be-94b2-1d6158e391a2","resolution":{"observed_at":"2026-08-05T20:19:01.262964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T20:18:59.256090Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.256090Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:aca5a56411a3c5709d368b6dc40feee54de7aa85d00f0b5a71929c4773bbd3a1","observation_id":"4ac9d3b7-609f-402d-9542-65b47ff08e6c","resolution":{"observed_at":"2026-08-05T20:18:59.256090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:00.893435Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"fd90ad12-2847-491e-b9dc-66a0faa19cf5","year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.386038Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:4973e162d105a4a7600fdb36217094850cb9d94f0e25a35b33fe5af2399058f4","observation_id":"f9c9358e-cfb8-4e7c-b1ee-a3fa940e5622","resolution":{"observed_at":"2026-08-05T20:19:01.004390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-05T20:18:59.503443Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.503443Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:2013ff2378ea2203398ed5d69fea87040930a1479302ce1e1c8fe4e5b9ec5483","observation_id":"d35a115d-3916-4428-bb43-9562a5110c40","resolution":{"observed_at":"2026-08-05T20:18:59.503443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19314","last_updated":"2025-05-01T05:02:57Z","snapshot_observed_at":"2026-08-06T05:37:40.638404Z","submitted_at":"2025-04-27T17:32:43Z","title":"BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19314","snapshot_observed_at":"2026-08-05T20:18:59.573267Z","title":"Browsecomp-zh: Benchmarking web browsing ability of large language models in chinese","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.573267Z"},"links":{"cited_paper":"/paper/2504.19314","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:2e43e7f24f3242b473727ecad6eedce4be39f5d48018b3947b2f1b8d3bd7187e","observation_id":"fdc03570-e332-412b-9fd4-e978e98ef471","resolution":{"observed_at":"2026-08-05T20:18:59.573267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:19:00.627285Z","title":"deepflowio/deepflow","venue":null,"work_id":"fdb2871a-3556-4bd7-992b-0736cb67bfd8","year":2025},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:59.692988Z"},"links":{"citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:415d041f42d65e65b758a2711ed5839b0e05259d98eaf4a9a56d017d5784b911","observation_id":"fa68709a-deef-4e9d-92ca-8d0303af9973","resolution":{"observed_at":"2026-08-05T20:19:00.735479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T07:57:40.346666Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 15 inbound Pith citation observations for arXiv:2508.13186."}