{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:JLW4JM6BCJEHV36LCVWAXJUVCC","short_pith_number":"pith:JLW4JM6B","schema_version":"1.0","canonical_sha256":"4aedc4b3c112487aefcb156c0ba69510b0c164ab428d41c50519e3d357b02a5a","source":{"kind":"arxiv","id":"2410.11538","version":1},"attestation_state":"computed","paper":{"title":"MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"An-Lan Wang, Bin Shan, Can Huang, Guozhi Tang, Jingqun Tang, Lei Liao, Wei Shi, Xiang Bai, Xiang Fei","submitted_at":"2024-10-15T12:13:42Z","abstract_excerpt":"The comprehension of text-rich visual scenes has become a focal point for evaluating Multi-modal Large Language Models (MLLMs) due to their widespread applications. Current benchmarks tailored to the scenario emphasize perceptual capabilities, while overlooking the assessment of cognitive abilities. To address this limitation, we introduce a Multimodal benchmark towards Text-rich visual scenes, to evaluate the Cognitive capabilities of MLLMs through visual reasoning and content-creation tasks (MCTBench). To mitigate potential evaluation bias from the varying distributions of datasets, MCTBench"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.11538","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2024-10-15T12:13:42Z","cross_cats_sorted":[],"title_canon_sha256":"acdca62b29054998c2f0e5ead94fba658cbedd4791e812ab95649b956951ea17","abstract_canon_sha256":"eb90b16a732fc051d2172acf2aa8b3ad68aac0fff1eef4ccf053e8d4e8b2e335"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:20:55.357442Z","signature_b64":"uye1ZVNqSRO2rflrcWzRdG8UsOKJ9KH9KnWZnyquIYUIQKE3RdF24TpEihN/twSHC75S1ILSKe90PuAl6ntOBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4aedc4b3c112487aefcb156c0ba69510b0c164ab428d41c50519e3d357b02a5a","last_reissued_at":"2026-07-05T09:20:55.356917Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:20:55.356917Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"An-Lan Wang, Bin Shan, Can Huang, Guozhi Tang, Jingqun Tang, Lei Liao, Wei Shi, Xiang Bai, Xiang Fei","submitted_at":"2024-10-15T12:13:42Z","abstract_excerpt":"The comprehension of text-rich visual scenes has become a focal point for evaluating Multi-modal Large Language Models (MLLMs) due to their widespread applications. Current benchmarks tailored to the scenario emphasize perceptual capabilities, while overlooking the assessment of cognitive abilities. To address this limitation, we introduce a Multimodal benchmark towards Text-rich visual scenes, to evaluate the Cognitive capabilities of MLLMs through visual reasoning and content-creation tasks (MCTBench). To mitigate potential evaluation bias from the varying distributions of datasets, MCTBench"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.11538","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.11538/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.11538","created_at":"2026-07-05T09:20:55.356979+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.11538v1","created_at":"2026-07-05T09:20:55.356979+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.11538","created_at":"2026-07-05T09:20:55.356979+00:00"},{"alias_kind":"pith_short_12","alias_value":"JLW4JM6BCJEH","created_at":"2026-07-05T09:20:55.356979+00:00"},{"alias_kind":"pith_short_16","alias_value":"JLW4JM6BCJEHV36L","created_at":"2026-07-05T09:20:55.356979+00:00"},{"alias_kind":"pith_short_8","alias_value":"JLW4JM6B","created_at":"2026-07-05T09:20:55.356979+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01602","citing_title":"ProWAFT: A ROMA-LPD Instance for Workload-Aware and Dynamic Fault Tolerance in FPGA-Based CNN Accelerators","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30189","citing_title":"DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18173","citing_title":"Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03339","citing_title":"Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27353","citing_title":"Gait Recognition via Deep Residual Networks and Multi-Branch Feature Fusion","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25188","citing_title":"Image Classification via Random Dilated Convolution with Multi-Branch Feature Extraction and Context Excitation","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25178","citing_title":"Lightweight Real-Time Rendering Parameter Optimization via XGBoost-Driven Lookup Tables","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00885","citing_title":"Multi-Branch Non-Homogeneous Image Dehazing via Concentration Partitioning and Image Fusion","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19233","citing_title":"Adaptive Slicing-Assisted Hyper Inference for Enhanced Small Object Detection in High-Resolution Imagery","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19259","citing_title":"Feature Perturbation Pool-based Fusion Network for Unified Multi-Class Industrial Defect Detection","ref_index":46,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC","json":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC.json","graph_json":"https://pith.science/api/pith-number/JLW4JM6BCJEHV36LCVWAXJUVCC/graph.json","events_json":"https://pith.science/api/pith-number/JLW4JM6BCJEHV36LCVWAXJUVCC/events.json","paper":"https://pith.science/paper/JLW4JM6B"},"agent_actions":{"view_html":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC","download_json":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC.json","view_paper":"https://pith.science/paper/JLW4JM6B","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.11538&json=true","fetch_graph":"https://pith.science/api/pith-number/JLW4JM6BCJEHV36LCVWAXJUVCC/graph.json","fetch_events":"https://pith.science/api/pith-number/JLW4JM6BCJEHV36LCVWAXJUVCC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC/action/storage_attestation","attest_author":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC/action/author_attestation","sign_citation":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC/action/citation_signature","submit_replication":"https://pith.science/pith/JLW4JM6BCJEHV36LCVWAXJUVCC/action/replication_record"}},"created_at":"2026-07-05T09:20:55.356979+00:00","updated_at":"2026-07-05T09:20:55.356979+00:00"}