{"as_of":"2026-08-07T04:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22ed9b2ddd4d433d07cf5850e9312256c622ff48b62777eeb1b37ce6087cfe53","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:18:41.518126Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21924/citation-record","integrity":"/paper/2507.21924/integrity","json":"/paper/2507.21924/citation-record.json","paper":"/paper/2507.21924"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.323457Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.323457Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:eff40ff89278ca5097d82f4c6d4067d0e5fe3543f86fd31025ce573457cffe79","observation_id":"5478395a-a3e2-4910-ab88-b83667be0c36","resolution":{"observed_at":"2026-08-06T12:18:31.323457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T12:18:31.561550Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.561550Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:a5a69d43a74ac2ee314a0b83840e7ea95973d3b7b093be111cc63b05dd7107a8","observation_id":"0462b592-f0b1-40a1-ab79-724f553592da","resolution":{"observed_at":"2026-08-06T12:18:31.561550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.688929Z","title":"Jawahar, Ernest Valveny, and Dimos- thenis Karatzas","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.688929Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:2a18817fe3b3b91bce63f8e3fcb8e758bf91e10c50d227ad15b5bb8e840752f5","observation_id":"d43985dd-d259-4ece-bddd-04e480c521b6","resolution":{"observed_at":"2026-08-06T12:18:31.688929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.821625Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text en- coding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.821625Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:b70f9ba4ba3f95a2999a4f4b70353f9f604503aceee3dd15b8749776aefb36f5","observation_id":"5e75490b-058d-4a84-81f8-52a64d95e4fb","resolution":{"observed_at":"2026-08-06T12:18:31.821625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-05T18:32:49.850038Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-06T12:18:31.887391Z","title":"Fireact: Toward lan- guage agent fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.887391Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:8dbd6bbcc47ab0ebc1ab78155895db5aa2326e746d6543424ad087b780ea07bc","observation_id":"3baeeb8c-e4ef-4928-8cff-4e32bae54d62","resolution":{"observed_at":"2026-08-06T12:18:31.887391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.962339Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.962339Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:7edd195861e40c4a8e7427ab8cf9f8cb681080dbf157be7fdc1d01271b8255d4","observation_id":"463991f0-cc00-40b0-8798-d05ee1827c01","resolution":{"observed_at":"2026-08-06T12:18:31.962339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.056475Z","title":"Are we on the right way for evaluating large vision-language models? In The Thirty-eighth Annual Con- ference on Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.056475Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:687e277ae84ce980ffc8b87b56df701e262957290182d3464212a4852b710a26","observation_id":"6705916d-5dbc-4a8f-8611-f80eeaf2b8f1","resolution":{"observed_at":"2026-08-06T12:18:32.056475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-07-06T18:20:05.707144Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-06T12:18:32.202517Z","title":"M 3 cot: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.202517Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:0c724a486214320ff994a3c7098db318cdfb3e6dbc6896dbaa4ee4c8171903cf","observation_id":"c5d95906-1dc0-47af-9f83-a6d76b8c75b1","resolution":{"observed_at":"2026-08-06T12:18:32.202517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-07T03:19:53.953867Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T12:18:32.356535Z","title":"Can pre-trained vision and language models answer vi- sual information-seeking questions? arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.356535Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:3ba830c372179bcd237592033dbbc91886f5ade464e4c4c1306022e64335eaf4","observation_id":"b2b48a63-6335-45e0-b0b6-35b2fc97d4c6","resolution":{"observed_at":"2026-08-06T12:18:32.356535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12881","last_updated":"2024-03-19T16:26:10Z","snapshot_observed_at":"2026-07-06T17:47:06.731501Z","submitted_at":"2024-03-19T16:26:10Z","title":"Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12881","snapshot_observed_at":"2026-08-06T12:18:32.447571Z","title":"Agent- flan: Designing data and methods of effective agent tuning for large language models.arXiv preprint arXiv:2403.12881,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.447571Z"},"links":{"cited_paper":"/paper/2403.12881","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:baa6f400a8dc8c8efb7687574d69fe398ed8511e4a0d81fa4d45a66a4c81fa44","observation_id":"b41b9cc9-cd38-4c58-9845-d34dd9504529","resolution":{"observed_at":"2026-08-06T12:18:32.447571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T12:18:32.551884Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.551884Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:9d8590bd7e06b1a09fdd0f5fb298fcfda7dbbf72746c1ffed8771cf401b97ce2","observation_id":"92c9f48c-c1af-4cba-885d-a314261a25bf","resolution":{"observed_at":"2026-08-06T12:18:32.551884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.676917Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.676917Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:acd8cfe992f1439e6d1779d54cffbf486ca831fcb0ac54757f56f428e0107f65","observation_id":"15d9bcc5-8cbf-46d3-96b5-c0b01a6075ea","resolution":{"observed_at":"2026-08-06T12:18:32.676917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.810532Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.810532Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:d8db0f3c6a4871334772aa35c0a764726c84df28d948cdee9f0c36fd33467c2b","observation_id":"a80648dd-7b1d-458c-ab83-446322737701","resolution":{"observed_at":"2026-08-06T12:18:32.810532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.899714Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.899714Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:ba69c585a216adbcb9aac12cf73dc80b21486333865e99b82ffbe12893466468","observation_id":"971d3421-3b28-423f-9ecc-977122187998","resolution":{"observed_at":"2026-08-06T12:18:32.899714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-08-06T12:18:33.133368Z","title":"Pp-ocr: A practical ultra lightweight ocr system","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.133368Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:2b41ba84170e878441c8af23c631c44c9fa6acefdd0f6a4e472f6c53b503f830","observation_id":"4f5df2a3-68f0-4fb0-9d97-992800e1cd89","resolution":{"observed_at":"2026-08-06T12:18:33.133368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:53.249151Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"396de713-1b4c-4d8c-8d58-4e8efdb0b366","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.235402Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:7704e987f9f80d2fc74da02b8f6a423aeb92f3d2a75e84097516a0122a6655dc","observation_id":"b5973dad-5e46-4e7a-9168-241b722a9d96","resolution":{"observed_at":"2026-08-06T12:18:53.445321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08640","last_updated":"2023-06-28T05:00:35Z","snapshot_observed_at":"2026-07-06T15:42:37.055739Z","submitted_at":"2023-06-14T17:12:56Z","title":"AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08640","snapshot_observed_at":"2026-08-06T12:18:33.353518Z","title":"Assistgpt: A gen- eral multi-modal assistant that can plan, execute, inspect, and learn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.353518Z"},"links":{"cited_paper":"/paper/2306.08640","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:6f601584b0e7c795c956c25fb762a49ea75650aa6466daf13c08dfe9ffbf259a","observation_id":"b764f13b-cc2a-4907-983f-74e1c22f8fe0","resolution":{"observed_at":"2026-08-06T12:18:33.353518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:53.002516Z","title":"Multi-modal agent tuning: Building a vlm-driven agent for efficient tool usage","venue":null,"work_id":"0f2933d9-bda3-44d0-bb55-c903e96bd1ac","year":2025},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.503296Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:a127636d87b86457eaac94a7d8c294be17b1fc17f5aa0368f6e6bd74d3244e5e","observation_id":"0b4a3181-5f0a-43df-9a38-1b3f554a584c","resolution":{"observed_at":"2026-08-06T12:18:53.080042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:52.715429Z","title":"Hallusionbench: an advanced diagnos- tic suite for entangled language hallucination and visual il- lusion in large vision-language models","venue":null,"work_id":"8085dbbd-8e36-404f-8544-bb2c9b8eead1","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.635653Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:af2b081803c178c5378f19ede4e80b145717f11f524541dd7c9b3375d8536f7b","observation_id":"e63cb2f6-1627-44cd-8a77-77aa298bd6b9","resolution":{"observed_at":"2026-08-06T12:18:52.871053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.799912Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.799912Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:4f4dbeead3ae6837e39b7be7dee531c37685b52e4ed88716286203b9a9d9d049","observation_id":"1d71c6f4-9663-4f51-bedf-903cc3f88412","resolution":{"observed_at":"2026-08-06T12:18:33.799912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:52.605420Z","title":"Icdar2019 compe- tition on scanned receipt ocr and information extraction","venue":null,"work_id":"124bc148-0e2d-4d50-bbd9-82a4c647136a","year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.926347Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:90235d5419676eb410c9496eb91a65221170531f1b1b137578d9f2eadc235ca1","observation_id":"eae346d7-dea3-4869-a0fd-8ff980354b34","resolution":{"observed_at":"2026-08-06T12:18:52.676694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:52.256054Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional 9 question answering","venue":null,"work_id":"bb5c0204-e42d-4d40-a884-7d505554410b","year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.070741Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:0ddcc8b17ed7e4949db1d55a5d6a541aabf302d4bf02e29e2b464b79b03675e4","observation_id":"3877697a-21a2-4942-8ffc-e5c49755e270","resolution":{"observed_at":"2026-08-06T12:18:52.425932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T12:18:34.176052Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.176052Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c41ef7670793351f65226af10a16ca43510b81f10e63e7e7d8e516768799dec8","observation_id":"7624ac31-6ceb-4462-b1f2-92689753961f","resolution":{"observed_at":"2026-08-06T12:18:34.176052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:51.981315Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":"97a4c1f2-72df-4578-a657-ff01df17582a","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.324440Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:7a7d4534a841df462595c7e2406d94ed8663a6aca777784315c2debfbfce7204","observation_id":"e6c32f4b-80b9-4a92-ba9d-501d5d813541","resolution":{"observed_at":"2026-08-06T12:18:52.105623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:51.654957Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"8cf6da31-0776-4fce-af7e-f688a8a81493","year":2016},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.473275Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:9964222b037eb6d62ead5898b9f18f4b11c2e74803137a11fda30ff54a027646","observation_id":"3cde0bb2-3704-4693-af26-65dc37e6cc7b","resolution":{"observed_at":"2026-08-06T12:18:51.795759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:51.114874Z","title":"Are you smarter than a sixth grader? textbook question answer- ing for multimodal machine comprehension","venue":null,"work_id":"ca7ae37f-4fdb-4277-8507-1ae8ce6d55a3","year":2017},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.736523Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:fccd83a2fcc259f3203e58f4c0cff23686319b2e5d60606fa835c8c08ca7205d","observation_id":"f257a9f9-e7c1-4d5c-a8b0-4517f4a3ed53","resolution":{"observed_at":"2026-08-06T12:18:51.269990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:50.911071Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":"a46de47d-d48c-4ff0-a2a5-a6029cfaa7d2","year":2020},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.828859Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:d99b6ccecd483a6c88f8bdf037bdcabbcae7c59aa45aeff26d89183fa1686edf","observation_id":"71b10f2c-bc23-4add-b219-882ce0430e63","resolution":{"observed_at":"2026-08-06T12:18:50.997805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:50.645558Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"7601ebdf-66d5-480b-9502-b03621a9a09a","year":1956},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.949585Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:87862257f14f5aee3eb5b7f6c0681cf7993cdf593167c1ba8de618fb6e413d6d","observation_id":"126b78f9-f3f7-4151-8c5e-c6987d0b1265","resolution":{"observed_at":"2026-08-06T12:18:50.784892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T12:18:35.087650Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.087650Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:0a3589c6f938c5e1bc00c29c96bdc50a87de5bcf57f93a3642d4f54299c32c45","observation_id":"cb91d659-f428-42cd-9432-dd29556578f5","resolution":{"observed_at":"2026-08-06T12:18:35.087650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:50.417633Z","title":"Kankanhalli","venue":null,"work_id":"d3471041-e9e6-4739-a611-6fd0aca28e1c","year":2017},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.219442Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:63a43954461fa0d94224f3a7b2c93266770c0f72db743c4e8319d6a4b17a93ef","observation_id":"32ee5be9-6523-403c-8df5-f6171b4f14aa","resolution":{"observed_at":"2026-08-06T12:18:50.510363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02937","last_updated":"2025-05-26T06:14:02Z","snapshot_observed_at":"2026-08-02T09:25:53.693440Z","submitted_at":"2024-11-05T09:27:21Z","title":"Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02937","snapshot_observed_at":"2026-08-06T12:18:35.368071Z","title":"Benchmarking multimodal retrieval augmented generation with dynamic vqa dataset and self- adaptive planning agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.368071Z"},"links":{"cited_paper":"/paper/2411.02937","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:b80a8a9c533b2c38afa7a9aeea39cb538c7f9b456a071f3f5fe9fd9effac3918","observation_id":"bf4c79f0-08e5-4ae4-9fb8-731fff0b5e2b","resolution":{"observed_at":"2026-08-06T12:18:35.368071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:50.172008Z","title":"Visual spatial reasoning","venue":null,"work_id":"bc05d2a0-ba4c-44c2-9db6-2acc647b7ac7","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.520950Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:4138ee14ab2c460174221adc6d13e8270690e9522cbd73a20ae169c944dd4e7d","observation_id":"e6dbb72a-e8be-4707-98fa-1a65ca8b36d9","resolution":{"observed_at":"2026-08-06T12:18:50.268677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.688521Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.688521Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c59cc7af54fee5f0ce2f7d0f04501f03cd0bda561b50493a3af6b8976b868545","observation_id":"150b32c7-24de-4cd7-a868-11d75292721e","resolution":{"observed_at":"2026-08-06T12:18:35.688521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.794468Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.794468Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:e342af35c01b5cf35da5cf43e6d1c5c984e26f2c487b241e90b6437075082b6a","observation_id":"c24c4f2e-b304-45f7-a192-054771395861","resolution":{"observed_at":"2026-08-06T12:18:35.794468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:49.930556Z","title":"Llava-plus: Learning to use tools for creating multi- modal agents","venue":null,"work_id":"fc40c5a9-f0d3-4449-b99b-07cb31541305","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.884051Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:f3a6bd17aa7ea79712ac431b640d013a663a7313573d01c6a0791e6e3328d776","observation_id":"da4acb6d-e861-4fe5-bc60-f8c68030414d","resolution":{"observed_at":"2026-08-06T12:18:50.028090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:49.650153Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"2f5f4254-d2fc-494c-86d1-994ef6a66011","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.050970Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:7a4d466ca2aabaaaa6bd1f5f2b02cc34af4f5f43c9c6b66d091c76962b17dce1","observation_id":"3c4785de-f488-46e6-894f-42253a8b2587","resolution":{"observed_at":"2026-08-06T12:18:49.759709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:49.402233Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"e384e11b-186f-4d7f-86ab-6783468157db","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.188259Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:d47c8e0a1b77cb98f04f73cca5f8f7046eef9d4fc652aa828f672d106d566d43","observation_id":"17eb8dc7-fd91-4c74-a714-e93a0aae3cc0","resolution":{"observed_at":"2026-08-06T12:18:49.507460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:49.072168Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and sym- bolic reasoning","venue":null,"work_id":"0aed73a0-7046-45b5-a94a-7f9ed6274082","year":2021},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.349318Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:d0703db2cc2df165f89ed4ffdef2ac948e8709d89ed949d35d7e8b60fd2bf422","observation_id":"e8520f35-a2c8-4be5-be7d-da8fdc5baeea","resolution":{"observed_at":"2026-08-06T12:18:49.280302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.812929Z","title":"Iconqa: A new benchmark for abstract diagram understand- ing and visual language reasoning","venue":null,"work_id":"b50ad4f9-0f9d-4ddd-9bd3-8eca2c8192bd","year":2021},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.452978Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:830097f11c13ef4dd3f9029675fdfb2d7989842da19dbac3c0a4dd4c3035f15b","observation_id":"eec69d49-8b0a-48c7-834b-7b86943d7753","resolution":{"observed_at":"2026-08-06T12:18:48.930150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.505184Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"9aa10b9e-8450-40e7-8a82-54d75e7778a7","year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.570393Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:0bd1c4489b7cf279633f4f874a32a91dd35306b72d4a06715c073ee75ed6bf47","observation_id":"ce7ff31f-0d94-4bb9-8493-408472c1e8f2","resolution":{"observed_at":"2026-08-06T12:18:48.664559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-07T02:52:46.435647Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-06T12:18:36.719126Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.719126Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:e514bda60f66238546ec160e88258ffcf4b182ac6f9ddaabed855de062e3950c","observation_id":"319aec87-0af3-4f86-bfe8-be9ab2818488","resolution":{"observed_at":"2026-08-06T12:18:36.719126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.257690Z","title":"Mathvista: Evaluating mathe- matical reasoning of foundation models in visual contexts","venue":null,"work_id":"ac6cc8a7-95ea-4daa-a6a7-87e585c26926","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.825822Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:4a3e245f9a8ae139b816a06b7506bdd99f0767d4c02b84d8a861b123540743e5","observation_id":"2ab389bd-043c-404e-8d5f-fce2f8f5d213","resolution":{"observed_at":"2026-08-06T12:18:48.351154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.217850Z","title":"ChartQA: A benchmark for question answer- ing about charts with visual and logical reasoning","venue":null,"work_id":"24a28bd5-2d95-4495-aab7-859c19f8ccd1","year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.926908Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:aaf3a42e6529587a2ef7faa3ba04c9acbc1f98150be404eff587d58335db3535","observation_id":"0780e952-e4e3-4756-b3fb-50787697b212","resolution":{"observed_at":"2026-08-06T12:18:48.243615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.081806Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"6604500e-87e2-43c5-b3e4-0cd1bb6646d2","year":2021},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.040447Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:a6f32fb730ab5c355c2d183e1decea9af28a11b24c1a627651a83dc8dd6dd3ec","observation_id":"6f07a7d3-977d-4b42-a5e1-42ec6e1e802e","resolution":{"observed_at":"2026-08-06T12:18:48.168702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.972901Z","title":"Infographicvqa","venue":null,"work_id":"191ab3db-4700-4836-9f40-70b0f8b73971","year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.177685Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:96493352c9682632671e282e01793fcea8eaeccbdc30d37eb776d62cb61c3925","observation_id":"1c296ffe-614f-4b16-b661-1b1a212f80d4","resolution":{"observed_at":"2026-08-06T12:18:48.004564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.874383Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"70c96431-78ad-4e92-8648-c5314225cb41","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.259659Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:fdb356f931483be920a02e9f78cc0bd47553c3e4e3b2c20a14f2afb28964c107","observation_id":"6ae9bfaa-2a9c-4804-aa2a-dc2b857795ce","resolution":{"observed_at":"2026-08-06T12:18:47.920183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.738572Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"4f3c91de-e275-4a21-b730-968f4743fedf","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.377593Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:fcdd89cbc99b9b5caeca2a74db34e5ab4596301b76503fbb48d887f8d26a80f0","observation_id":"71d02cb0-f2c3-4195-be9c-e0e90823e35f","resolution":{"observed_at":"2026-08-06T12:18:47.797006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.606591Z","title":"Compositional semantic parsing on semi-structured tables","venue":null,"work_id":"166f1fe1-ed7c-459a-a863-9136b71012c6","year":2015},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.497595Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:32f296abee73138e827987c819c6652f98de145c4b15a8ccdb80917a9a988e69","observation_id":"89d54ed3-7d75-46e4-9c19-469c7336160e","resolution":{"observed_at":"2026-08-06T12:18:47.676234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.469293Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"6b9033c2-ba0a-4740-956a-dafd8c774269","year":2015},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.575202Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:f67d5703aedc887c6d08d0e0483c93653fd3436bf60aa7b955307ee771c2089e","observation_id":"53b939d8-6681-442e-976a-2f9777000580","resolution":{"observed_at":"2026-08-06T12:18:47.533383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.344463Z","title":"A benchmark of facial recognition pipelines and co-usability performances of mod- ules","venue":null,"work_id":"2b2cb9c4-0951-4ce5-bf3e-f7e3645197d4","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.702678Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:5bd09415cb3a516856f8d609296e562245e28c35f6efecd215e6a2bedf10ba9a","observation_id":"67ba3997-6b2a-4bf6-96b9-68bb29ab71f5","resolution":{"observed_at":"2026-08-06T12:18:47.367570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.240389Z","title":"Putting gpt-4o to the sword: A comprehensive evaluation of language, vision, speech, and multimodal proficiency","venue":null,"work_id":"4d526bb4-ffe4-4157-8561-9dd3053de362","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.818888Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:09149745bd6b4098e14f334600e6ee53cb2324fa29ca67cdeacfc1650656f54b","observation_id":"65e6ac54-3195-45f1-bb0a-adf7d0b85a17","resolution":{"observed_at":"2026-08-06T12:18:47.277223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.089229Z","title":"Visual cot: Advancing multi-modal language models with a comprehen- sive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"f7eeda6e-7eee-4c8e-98ce-3f3997cc300c","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.933670Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:3e8bb73cea960e1afb1f1f9a80a4417e692752db4db4f5b23304a26708b97722","observation_id":"1494792a-ecc3-4427-8057-b946dd8698eb","resolution":{"observed_at":"2026-08-06T12:18:47.182352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:38.079081Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.079081Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:fb73b3a030cca416f2f39551cf62556512fdb6f94eb4a221ffe7335151bb8ff1","observation_id":"be5ce8d3-57c9-458f-9ab8-cb9c930acd9a","resolution":{"observed_at":"2026-08-06T12:18:38.079081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:38.200474Z","title":"Textcaps: a dataset for image caption- ing with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.200474Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:22a0283faf6a2e485299d1c7ed9f714be29ead3d5891fde0e81b0916c4960f2d","observation_id":"d7963086-d156-4656-8cc0-45f01486735e","resolution":{"observed_at":"2026-08-06T12:18:38.200474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:46.935806Z","title":"Towards vqa models that can read","venue":null,"work_id":"f3e173e7-cc73-4325-b876-0df21eb1a2a0","year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.315186Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c092ef3b2084caac7cf77645b9d460c84c5cef2917c8e8d8f8e1b193a4a6c209","observation_id":"031f965e-c81e-47ce-990d-88f3dc516a55","resolution":{"observed_at":"2026-08-06T12:18:46.982901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-07-06T17:39:32.800594Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-06T12:18:38.403343Z","title":"Trial and error: Exploration-based trajectory optimization for llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.403343Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:5af527b1321b1f0d4cdc504d5c8076d85a7ec7cef34819ec6b363f97c03d31aa","observation_id":"957c6707-7fcb-4195-84a1-e72f0b84820a","resolution":{"observed_at":"2026-08-06T12:18:38.403343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:46.669731Z","title":"Tang, Angie Boggust, and Arvind Satyanarayan","venue":null,"work_id":"7cbb8d9a-0672-4a9b-87ad-6218a28e0026","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.500912Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:56bc078b011439afd848d90f870437ad836142feec294315d8bbda473918991f","observation_id":"cc460c53-afcf-45cc-bb4e-231079fc7c88","resolution":{"observed_at":"2026-08-06T12:18:46.756525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T12:18:38.622584Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.622584Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:201e1c34653204e1cda07fda7945727dc1dfb386bf0153ae487bb7abf4dbb8dd","observation_id":"e04a0778-012f-48fb-91de-e1f8e17e9509","resolution":{"observed_at":"2026-08-06T12:18:38.622584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:46.428829Z","title":"Document understanding dataset and evaluation (dude)","venue":null,"work_id":"d463c27d-d9ba-4ac1-a07f-6698b1c5df68","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.703728Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:69f5eb6d2f73680a64cb5fc13f443a29a48ea8ebaaf063628434ffccad073c96","observation_id":"771ed215-2e01-4c95-beb8-e346183c90ee","resolution":{"observed_at":"2026-08-06T12:18:46.522644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:46.177873Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":"b65401bb-bb36-4dc9-9a13-c1542a9e39a9","year":2011},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.811721Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:91bfaa830cd240f75b00c713d278d5e43f20bd47710bb68d075603e3f1eb3ee6","observation_id":"8a635456-6fae-42b1-b5e6-1c6d2232609a","resolution":{"observed_at":"2026-08-06T12:18:46.288111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.976762Z","title":"Screen2words: Automatic mobile ui summarization with multimodal learning","venue":null,"work_id":"a470a18e-dbd8-42dd-805f-9615937e15f1","year":2021},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.899604Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:1b974921e714264a78bf667866aa2c4f094b63f22c8d9c5948999b93c7536251","observation_id":"17cea784-ef6c-4838-ba07-805935d5b36f","resolution":{"observed_at":"2026-08-06T12:18:46.064600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04746","last_updated":"2024-03-07T18:50:51Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T18:50:51Z","title":"LLMs in the Imaginarium: Tool Learning through Simulated Trial and Error","version":1},"cited_work":{"arxiv_id":"2403.04746","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04746","snapshot_observed_at":"2026-08-06T12:18:41.756866Z","title":"LLMs in the Imaginarium: Tool Learning through Simulated Trial and Error","venue":"cs.CL","work_id":"a4228b51-e3a5-4542-a7d3-dc5e1e902e5b","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.029360Z"},"links":{"cited_paper":"/paper/2403.04746","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:0b175f0a4bb876dd7412ae62eaec56d8648ddbf4cd3322d0566176d709a5743a","observation_id":"3d2fe1c4-0a8c-4ee2-bfd4-ebe8f53cfd67","resolution":{"observed_at":"2026-08-06T12:18:41.874604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10727","last_updated":"2025-04-11T10:01:13Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T14:44:37Z","title":"MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10727","snapshot_observed_at":"2026-08-06T12:18:39.118189Z","title":"Mllm-tool: A multimodal large language model for tool agent learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.118189Z"},"links":{"cited_paper":"/paper/2401.10727","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:28a5485022133f2944965f71d85d7f7b7a59fa015a268aa8e795184330b8273a","observation_id":"7509c407-ae30-4486-8ab7-12cd21de8e94","resolution":{"observed_at":"2026-08-06T12:18:39.118189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.740010Z","title":"Mea- suring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"06032c77-d763-4aec-90e6-a5316ba0230e","year":2025},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.207676Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:198b0d2816ed3a458ea49066d7405dd9c11330d9dd7e43591f41eb827df8dd06","observation_id":"29515936-2adf-4b96-8dcd-d245ff7c8558","resolution":{"observed_at":"2026-08-06T12:18:45.869578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T12:18:39.306583Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.306583Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:7728791e155b79e6562387e767f839b0cf641e3f1bb43371d646d83c0cd32cd4","observation_id":"5e426e2b-2a9f-4ee5-b01b-71570168c1a5","resolution":{"observed_at":"2026-08-06T12:18:39.306583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-06T12:18:39.399123Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.399123Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:27630afad721d4c86ddd7fef88dff9d7d6aa4e29c9f544fbb9e217a08d514692","observation_id":"b2630173-c5e9-4b66-b4b2-b531121a1309","resolution":{"observed_at":"2026-08-06T12:18:39.399123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.502258Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"2fc7993d-d13c-4f47-9bcd-965135a5af06","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.504236Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:47193c944eb988d588e68c45875ba84e987e7b266a3866545f30267fff1e4392","observation_id":"4197aa3f-1e21-4c07-b7c3-0bd0709b8881","resolution":{"observed_at":"2026-08-06T12:18:45.603526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T12:18:39.605249Z","title":"Llava-o1: Let vision language models reason step- by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.605249Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:402f9bae7b68d37a4982b92c10921f0e406cb38506c7e4217224015b12576513","observation_id":"744db546-4e65-46b4-96d3-0275004cc8e8","resolution":{"observed_at":"2026-08-06T12:18:39.605249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.256798Z","title":"Llava-cot: Let vision language models reason step- by-step, 2024","venue":null,"work_id":"3ef3322e-e53a-450a-b964-382c3361dc1f","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.749545Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:eea9ccc1c347c6d932523439910378629a2515e47457c91ff1e212c1ea52ef49","observation_id":"6af0f074-14a1-49a9-a077-7722867c6ca3","resolution":{"observed_at":"2026-08-06T12:18:45.387347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.003711Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction","venue":null,"work_id":"190356cb-5940-4797-90bc-71f49645fd6e","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.829944Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:4ab66142d50acb33a15eaca94c2d3c245edd3f17b19c997fc6050df44a71c745","observation_id":"6f935308-2bd6-42db-a8bb-dbd13a588ae8","resolution":{"observed_at":"2026-08-06T12:18:45.106833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:44.762502Z","title":"React: Synergizing rea- soning and acting in language models","venue":null,"work_id":"522ed7f3-3f9b-48fb-93aa-04a565582bb3","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.900854Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:8fc62c70e57deb3f65762deb2f6dd1f2e06f662dcc274d5afb92b251a1a47e89","observation_id":"fc6a8b88-5b9e-4155-82de-657a638a8d80","resolution":{"observed_at":"2026-08-06T12:18:44.865434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T12:18:40.013192Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.013192Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:91e27573a10b8535783350065bb2e4d561f8fd2a0b06fc6457861d39f64217d8","observation_id":"6aed4166-fd33-4939-ae15-4e8f720b5c6a","resolution":{"observed_at":"2026-08-06T12:18:40.013192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:44.567121Z","title":"Agent lumos: Unified and modular training for open-source language agents","venue":null,"work_id":"03fa697e-9b47-42c3-9d00-0d4b7be08ebf","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.111923Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:cd517ac5c1021f4eb1e036b21cb8f3cd769c69eb0ff6c54a540ec7778a008609","observation_id":"bed3ff95-f0d1-42b0-b8b5-0604add61aee","resolution":{"observed_at":"2026-08-06T12:18:44.640480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:44.295859Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"3fda3734-6279-4ef5-b1e8-04744779c103","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.209708Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:5229d0c14d8086025a1799d87a6cfaab1ae60c5b5045a3d235dfc793b264f296","observation_id":"09ac949a-d7ff-4981-a42b-e5acb84a3f31","resolution":{"observed_at":"2026-08-06T12:18:44.437025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-07-06T16:35:40.224690Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-06T12:18:40.313560Z","title":"Agenttuning: En- abling generalized agent abilities for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.313560Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:742c7ba3e607e3163f37cf60b8049be36ae653299e7a39423c378e562ff20954","observation_id":"565e3f9f-ecd4-4be0-a9e7-b16f64f828c3","resolution":{"observed_at":"2026-08-06T12:18:40.313560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:44.062117Z","title":"Raven: A dataset for relational and analogical visual reasoning","venue":null,"work_id":"b5bbf6a3-a7cd-4eff-ac25-c4cb334ca35f","year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.418499Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:973da102387ccc1ca5005a5fa45caefc7786ede4846ea06f90dff0e40107bd91","observation_id":"0967ca33-3478-437a-911a-75eb29b5b5d5","resolution":{"observed_at":"2026-08-06T12:18:44.189547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:43.872458Z","title":"Swift:a scal- able lightweight infrastructure for fine-tuning, 2024","venue":null,"work_id":"953a9170-5671-4bad-b040-60c50d637abe","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.563398Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:4705391875e67a949df710cce84f92bdfbb516bd80195123efaacc62eeb7d3d4","observation_id":"0cc7d3f4-c98e-406c-8321-11f839aad7c7","resolution":{"observed_at":"2026-08-06T12:18:43.965856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:43.665967Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning, 2017","venue":null,"work_id":"06d57c4b-da7f-43f5-a7b3-eba2fe860c82","year":2017},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.636458Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:56013a32327ef7f824d4f787583a565a8bd6f662b2d34e5ff9e23e372b909a76","observation_id":"4411d2fb-c374-493c-8caa-d4770086b41b","resolution":{"observed_at":"2026-08-06T12:18:43.750174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:43.400294Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":"d37744df-fdb2-41bf-a2fb-904d9972fa43","year":2016},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.695193Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:06eb0d4ab963b77d445834f3837c2e7a103e98a6561ae2bc295d7c3d8b6fe06a","observation_id":"de5ef537-70bf-40f3-9766-c216ab3a5fd5","resolution":{"observed_at":"2026-08-06T12:18:43.524971Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:40.808887Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.808887Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:ab391d87f348db1fa1d7e92d36564de4b19ae580d54f240604f75275ba271774","observation_id":"5256053a-33dd-46de-8251-152ba8f8af31","resolution":{"observed_at":"2026-08-06T12:18:40.808887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:40.922255Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.922255Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:8a80adf5c3bddbba1e2381a8bc8ffb71ce706151ea1398a2b6e927f8c3e42522","observation_id":"c81563ba-84aa-460c-a47c-c3f38c58dd28","resolution":{"observed_at":"2026-08-06T12:18:40.922255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:43.121637Z","title":"objects\": [","venue":null,"work_id":"a0935625-1b85-49bd-86bf-e60ba92fbbf4","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.042512Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:6de13bf86b19eb92be0d4d4c082959b5db1102175ecc389aa997fb98d3411b15","observation_id":"8c1b6981-1d26-4138-b7c8-99894dea8acf","resolution":{"observed_at":"2026-08-06T12:18:43.246936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:42.867039Z","title":null,"venue":null,"work_id":"89d87364-5601-461f-9bcc-c168b939dfe8","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.141614Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:1eee450b03fcef8bf516f08509907f5e55ca9eacecc18a5147db7b245d51566d","observation_id":"05128088-b15e-47bb-ac2d-8c23e84e2e5c","resolution":{"observed_at":"2026-08-06T12:18:42.999932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:42.619399Z","title":"image_caption","venue":null,"work_id":"a81e3ea4-1d56-4125-bb9c-c3acfc908cd0","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.259999Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:f86a5fb4147894a8b72daceb5cd1fc054f70a66a2a0cbdb0eb26d2d9b98c39bd","observation_id":"3f7bae2a-c3bb-48b8-98f5-9085610ac3ff","resolution":{"observed_at":"2026-08-06T12:18:42.706027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:42.391975Z","title":"needed\": true,","venue":null,"work_id":"791da42b-db94-400e-b079-4cee2140f5f8","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.390516Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:64877c23795ee28015d0cb78af94714768a97663126d8333c5fc376570092d7d","observation_id":"d5f08797-6684-43ed-88c0-c5610b21feb7","resolution":{"observed_at":"2026-08-06T12:18:42.471282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:42.169099Z","title":"continue","venue":null,"work_id":"4fb730a4-cce8-4a13-bc52-3eca8d5a8904","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.518126Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:738e18e4b2fa5bb63df1181f36607c97e48bf729611e2e37b5f8b3bafd473ae1","observation_id":"72e7adf1-f915-45ba-b014-9a7760bf60b4","resolution":{"observed_at":"2026-08-06T12:18:42.265587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.027058Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.027058Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:4390c75598cb0aa72e5a5bd03b9d1a4119d0188b3ba1734e1cfe176c9bfd665a","observation_id":"d63ce0b8-1ee8-4fc6-a71d-aea9de96110b","resolution":{"observed_at":"2026-08-06T12:18:33.027058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:51.421998Z","title":null,"venue":null,"work_id":"cf1c1a00-3cfa-49bd-83a0-587800ef3f2c","year":2016},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.612419Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:387ab805bbf53dfa302465284fbcc47063d0b1e9310c1115bc28685715633937","observation_id":"cf2204af-5146-43f9-9318-0ccc42de42dc","resolution":{"observed_at":"2026-08-06T12:18:51.528283Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T12:18:31.416961Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.416961Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:08df3dffcf8bec63024a38248634edce86642094d0d634d079fd90b3ea99fd01","observation_id":"846a591b-e1c1-4d71-bf21-87c1e714b30f","resolution":{"observed_at":"2026-08-06T12:18:31.416961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T02:53:11.760175Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":38,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2507.21924."}