{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:T6C2XQJQFHQI5RGBGHLFFTRN6X","short_pith_number":"pith:T6C2XQJQ","schema_version":"1.0","canonical_sha256":"9f85abc13029e08ec4c131d652ce2df5c6d59a87af27e0c41b17404c22949886","source":{"kind":"arxiv","id":"2407.16837","version":2},"attestation_state":"computed","paper":{"title":"MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Arpita Chowdhury, Jihyung Kil, Justin Lee, Kerrie Cheng, Lemeng Wang, Wei-Lun Chao, Ye Liu, Zheda Mai, Zihe Wang","submitted_at":"2024-07-23T21:02:38Z","abstract_excerpt":"The ability to compare objects, scenes, or situations is crucial for effective decision-making and problem-solving in everyday life. For instance, comparing the freshness of apples enables better choices during grocery shopping while comparing sofa designs helps optimize the aesthetics of our living space. Despite its significance, the comparative capability is largely unexplored in artificial general intelligence (AGI). In this paper, we introduce MLLM-CompBench, a benchmark designed to evaluate the comparative reasoning capability of multimodal large language models (MLLMs). MLLM-CompBench m"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.16837","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-07-23T21:02:38Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"1387161a8d5d3dbfbb2fbbb476ea83c995cec79dcaf377c5a7cf13c667d1fdbb","abstract_canon_sha256":"8934c6d2f5e851a00ea65b2e00f566f9a7b30254886744ee86f79dc38ce84f5b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:59:50.567954Z","signature_b64":"FuGBv7LeBk0ATG2bblaGyVLpTuLVh6LutBpRJrkbsczwLaPpZC1iMQCT4Y2ldGwuxv7QgqfvAAG648HWUFwxBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9f85abc13029e08ec4c131d652ce2df5c6d59a87af27e0c41b17404c22949886","last_reissued_at":"2026-07-05T09:59:50.567554Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:59:50.567554Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Arpita Chowdhury, Jihyung Kil, Justin Lee, Kerrie Cheng, Lemeng Wang, Wei-Lun Chao, Ye Liu, Zheda Mai, Zihe Wang","submitted_at":"2024-07-23T21:02:38Z","abstract_excerpt":"The ability to compare objects, scenes, or situations is crucial for effective decision-making and problem-solving in everyday life. For instance, comparing the freshness of apples enables better choices during grocery shopping while comparing sofa designs helps optimize the aesthetics of our living space. Despite its significance, the comparative capability is largely unexplored in artificial general intelligence (AGI). In this paper, we introduce MLLM-CompBench, a benchmark designed to evaluate the comparative reasoning capability of multimodal large language models (MLLMs). MLLM-CompBench m"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.16837","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.16837/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.16837","created_at":"2026-07-05T09:59:50.567611+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.16837v2","created_at":"2026-07-05T09:59:50.567611+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.16837","created_at":"2026-07-05T09:59:50.567611+00:00"},{"alias_kind":"pith_short_12","alias_value":"T6C2XQJQFHQI","created_at":"2026-07-05T09:59:50.567611+00:00"},{"alias_kind":"pith_short_16","alias_value":"T6C2XQJQFHQI5RGB","created_at":"2026-07-05T09:59:50.567611+00:00"},{"alias_kind":"pith_short_8","alias_value":"T6C2XQJQ","created_at":"2026-07-05T09:59:50.567611+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2603.11689","citing_title":"Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks","ref_index":32,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X","json":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X.json","graph_json":"https://pith.science/api/pith-number/T6C2XQJQFHQI5RGBGHLFFTRN6X/graph.json","events_json":"https://pith.science/api/pith-number/T6C2XQJQFHQI5RGBGHLFFTRN6X/events.json","paper":"https://pith.science/paper/T6C2XQJQ"},"agent_actions":{"view_html":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X","download_json":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X.json","view_paper":"https://pith.science/paper/T6C2XQJQ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.16837&json=true","fetch_graph":"https://pith.science/api/pith-number/T6C2XQJQFHQI5RGBGHLFFTRN6X/graph.json","fetch_events":"https://pith.science/api/pith-number/T6C2XQJQFHQI5RGBGHLFFTRN6X/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X/action/timestamp_anchor","attest_storage":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X/action/storage_attestation","attest_author":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X/action/author_attestation","sign_citation":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X/action/citation_signature","submit_replication":"https://pith.science/pith/T6C2XQJQFHQI5RGBGHLFFTRN6X/action/replication_record"}},"created_at":"2026-07-05T09:59:50.567611+00:00","updated_at":"2026-07-05T09:59:50.567611+00:00"}