{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:4FRD6IBYCDYDZ7DHX4ELVGWN5V","short_pith_number":"pith:4FRD6IBY","schema_version":"1.0","canonical_sha256":"e1623f203810f03cfc67bf08ba9acded724a264cce09c5aac4aca80c6e47f313","source":{"kind":"arxiv","id":"2410.12219","version":1},"attestation_state":"computed","paper":{"title":"OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.MM"],"primary_cat":"cs.AI","authors_text":"Boqing Gong, Heng Huang, Hexiang Hu, Lichang Chen, Mingda Zhang, Ming-Hsuan Yang, Pranav Shyam, Tianyi Zhou, Yandong Li, Yiwen Chen, Zifeng Wang","submitted_at":"2024-10-16T04:29:46Z","abstract_excerpt":"We introduce OmnixR, an evaluation suite designed to benchmark SoTA Omni-modality Language Models, such as GPT-4o and Gemini. Evaluating OLMs, which integrate multiple modalities such as text, vision, and audio, presents unique challenges. Particularly, the user message might often consist of multiple modalities, such that OLMs have to establish holistic understanding and reasoning across modalities to accomplish the task. Existing benchmarks are limited to single modality or dual-modality tasks, overlooking comprehensive multi-modal assessments of model reasoning. To address this, OmnixR offe"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.12219","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-10-16T04:29:46Z","cross_cats_sorted":["cs.CL","cs.MM"],"title_canon_sha256":"57d883b6e03ebe522625d803181ad4972c46d35180022a5da96f1b7e719c4ffa","abstract_canon_sha256":"920eb736bae426844a1aeabbf7ca16f8d71303e5a9d7f81d5eb5e2fbe4849e27"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:21:16.169236Z","signature_b64":"w1TL0CO2/dgo3upLsTBfEKHGlHC0o7xyINoVLMMhv+UQ+mOdiEFnP2I/UhG+qZjOdyYPVhY0mSDedUFLzN+uCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e1623f203810f03cfc67bf08ba9acded724a264cce09c5aac4aca80c6e47f313","last_reissued_at":"2026-07-05T09:21:16.168814Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:21:16.168814Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.MM"],"primary_cat":"cs.AI","authors_text":"Boqing Gong, Heng Huang, Hexiang Hu, Lichang Chen, Mingda Zhang, Ming-Hsuan Yang, Pranav Shyam, Tianyi Zhou, Yandong Li, Yiwen Chen, Zifeng Wang","submitted_at":"2024-10-16T04:29:46Z","abstract_excerpt":"We introduce OmnixR, an evaluation suite designed to benchmark SoTA Omni-modality Language Models, such as GPT-4o and Gemini. Evaluating OLMs, which integrate multiple modalities such as text, vision, and audio, presents unique challenges. Particularly, the user message might often consist of multiple modalities, such that OLMs have to establish holistic understanding and reasoning across modalities to accomplish the task. Existing benchmarks are limited to single modality or dual-modality tasks, overlooking comprehensive multi-modal assessments of model reasoning. To address this, OmnixR offe"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.12219","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.12219/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.12219","created_at":"2026-07-05T09:21:16.168870+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.12219v1","created_at":"2026-07-05T09:21:16.168870+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.12219","created_at":"2026-07-05T09:21:16.168870+00:00"},{"alias_kind":"pith_short_12","alias_value":"4FRD6IBYCDYD","created_at":"2026-07-05T09:21:16.168870+00:00"},{"alias_kind":"pith_short_16","alias_value":"4FRD6IBYCDYDZ7DH","created_at":"2026-07-05T09:21:16.168870+00:00"},{"alias_kind":"pith_short_8","alias_value":"4FRD6IBY","created_at":"2026-07-05T09:21:16.168870+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.07643","citing_title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00959","citing_title":"Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2512.08923","citing_title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","ref_index":8,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V","json":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V.json","graph_json":"https://pith.science/api/pith-number/4FRD6IBYCDYDZ7DHX4ELVGWN5V/graph.json","events_json":"https://pith.science/api/pith-number/4FRD6IBYCDYDZ7DHX4ELVGWN5V/events.json","paper":"https://pith.science/paper/4FRD6IBY"},"agent_actions":{"view_html":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V","download_json":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V.json","view_paper":"https://pith.science/paper/4FRD6IBY","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.12219&json=true","fetch_graph":"https://pith.science/api/pith-number/4FRD6IBYCDYDZ7DHX4ELVGWN5V/graph.json","fetch_events":"https://pith.science/api/pith-number/4FRD6IBYCDYDZ7DHX4ELVGWN5V/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V/action/storage_attestation","attest_author":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V/action/author_attestation","sign_citation":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V/action/citation_signature","submit_replication":"https://pith.science/pith/4FRD6IBYCDYDZ7DHX4ELVGWN5V/action/replication_record"}},"created_at":"2026-07-05T09:21:16.168870+00:00","updated_at":"2026-07-05T09:21:16.168870+00:00"}