{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:MZT5BHUOGCICVJQIXMF4PZKG57","short_pith_number":"pith:MZT5BHUO","schema_version":"1.0","canonical_sha256":"6667d09e8e30902aa608bb0bc7e546efce89b7eee40721c39df540515be970ea","source":{"kind":"arxiv","id":"2601.06521","version":2},"attestation_state":"computed","paper":{"title":"BabyVision: Visual Reasoning Beyond Language","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Baobao Chang, Fangfu Liu, Guopeng Li, Haiyang Shen, Hans Zhao, Haoning Wu, Haoyu Lu, Hongfeng He, Kaiyuan Chen, Kuan Li, Liang Chen, Ming Wu, Shuzheng Si, Tianyu Liu, Weichu Xie, Wendong Xu, Wenhao Chai, Xiaobo Hu, Xuanzhong Chen, Yang Liu, Y. Charles, Yiping Bao, Yixin Ren, Yiyan Liang, Yuan Gong, Yuantao Fan, Zefan Cai, Zhibo Yang, Zhiqi Huang, Ziqi Huang","submitted_at":"2026-01-10T10:42:44Z","abstract_excerpt":"While humans develop core visual skills long before acquiring language, contemporary Multimodal LLMs (MLLMs) still rely heavily on linguistic priors to compensate for their fragile visual understanding. We uncovered a crucial fact: state-of-the-art MLLMs consistently fail on basic visual tasks that humans, even 3-year-olds, can solve effortlessly. To systematically investigate this gap, we introduce BabyVision, a benchmark designed to assess core visual abilities independent of linguistic knowledge for MLLMs. BabyVision spans a wide range of tasks, with 388 items divided into 22 subclasses acr"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2601.06521","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2026-01-10T10:42:44Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"39b8de3f26956be41342086393767becabc558491f7c9d889ec21d5fb410921c","abstract_canon_sha256":"0fb39b5127390a8ffe372f7f1b22a9f87cb3bf3594c245f9aaddd2625295d629"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-08T01:19:09.495998Z","signature_b64":"S14gNvTlW8klczrKtyBH5YXAkOtL4SFNpFPI5Q5NI30VenZqbOzOxL6jyQY1ZDVTWQzAaMYbQjcDfjimqSmkAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6667d09e8e30902aa608bb0bc7e546efce89b7eee40721c39df540515be970ea","last_reissued_at":"2026-07-08T01:19:09.495394Z","signature_status":"signed_v1","first_computed_at":"2026-07-08T01:19:09.495394Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"BabyVision: Visual Reasoning Beyond Language","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Baobao Chang, Fangfu Liu, Guopeng Li, Haiyang Shen, Hans Zhao, Haoning Wu, Haoyu Lu, Hongfeng He, Kaiyuan Chen, Kuan Li, Liang Chen, Ming Wu, Shuzheng Si, Tianyu Liu, Weichu Xie, Wendong Xu, Wenhao Chai, Xiaobo Hu, Xuanzhong Chen, Yang Liu, Y. Charles, Yiping Bao, Yixin Ren, Yiyan Liang, Yuan Gong, Yuantao Fan, Zefan Cai, Zhibo Yang, Zhiqi Huang, Ziqi Huang","submitted_at":"2026-01-10T10:42:44Z","abstract_excerpt":"While humans develop core visual skills long before acquiring language, contemporary Multimodal LLMs (MLLMs) still rely heavily on linguistic priors to compensate for their fragile visual understanding. We uncovered a crucial fact: state-of-the-art MLLMs consistently fail on basic visual tasks that humans, even 3-year-olds, can solve effortlessly. To systematically investigate this gap, we introduce BabyVision, a benchmark designed to assess core visual abilities independent of linguistic knowledge for MLLMs. BabyVision spans a wide range of tasks, with 388 items divided into 22 subclasses acr"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2601.06521","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2601.06521/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2601.06521","created_at":"2026-07-08T01:19:09.495485+00:00"},{"alias_kind":"arxiv_version","alias_value":"2601.06521v2","created_at":"2026-07-08T01:19:09.495485+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2601.06521","created_at":"2026-07-08T01:19:09.495485+00:00"},{"alias_kind":"pith_short_12","alias_value":"MZT5BHUOGCIC","created_at":"2026-07-08T01:19:09.495485+00:00"},{"alias_kind":"pith_short_16","alias_value":"MZT5BHUOGCICVJQI","created_at":"2026-07-08T01:19:09.495485+00:00"},{"alias_kind":"pith_short_8","alias_value":"MZT5BHUO","created_at":"2026-07-08T01:19:09.495485+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":22,"internal_anchor_count":22,"sample":[{"citing_arxiv_id":"2607.08317","citing_title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","ref_index":16,"is_internal_anchor":true},{"citing_arxiv_id":"2606.25319","citing_title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","ref_index":1,"is_internal_anchor":true},{"citing_arxiv_id":"2606.18216","citing_title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","ref_index":131,"is_internal_anchor":true},{"citing_arxiv_id":"2607.00248","citing_title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","ref_index":26,"is_internal_anchor":true},{"citing_arxiv_id":"2606.05497","citing_title":"LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, \"Is Your VLM Smarter Than a 5th Grader?\")","ref_index":27,"is_internal_anchor":true},{"citing_arxiv_id":"2606.01667","citing_title":"ATLAS: Agentic Test-time Learning-to-Allocate Scaling","ref_index":6,"is_internal_anchor":true},{"citing_arxiv_id":"2605.09883","citing_title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"2606.00562","citing_title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","ref_index":108,"is_internal_anchor":true},{"citing_arxiv_id":"2604.20665","citing_title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2605.20942","citing_title":"Bridging Structure and Language: Graph-Based Visual Reasoning for Autonomous Road Understanding","ref_index":12,"is_internal_anchor":true},{"citing_arxiv_id":"2605.15672","citing_title":"VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following","ref_index":8,"is_internal_anchor":true},{"citing_arxiv_id":"2605.17291","citing_title":"Step-wise Rubric Rewards for LLM Reasoning","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2605.19130","citing_title":"EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"2604.02486","citing_title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","ref_index":2,"is_internal_anchor":true},{"citing_arxiv_id":"2605.12500","citing_title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","ref_index":15,"is_internal_anchor":true},{"citing_arxiv_id":"2605.09883","citing_title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"2605.01402","citing_title":"Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression","ref_index":93,"is_internal_anchor":true},{"citing_arxiv_id":"2605.09693","citing_title":"Do multimodal models imagine electric sheep?","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"2605.01402","citing_title":"Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression","ref_index":93,"is_internal_anchor":true},{"citing_arxiv_id":"2604.20665","citing_title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2604.08644","citing_title":"EXAONE 4.5 Technical Report","ref_index":11,"is_internal_anchor":true},{"citing_arxiv_id":"2602.02276","citing_title":"Kimi K2.5: Visual Agentic Intelligence","ref_index":12,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57","json":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57.json","graph_json":"https://pith.science/api/pith-number/MZT5BHUOGCICVJQIXMF4PZKG57/graph.json","events_json":"https://pith.science/api/pith-number/MZT5BHUOGCICVJQIXMF4PZKG57/events.json","paper":"https://pith.science/paper/MZT5BHUO"},"agent_actions":{"view_html":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57","download_json":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57.json","view_paper":"https://pith.science/paper/MZT5BHUO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2601.06521&json=true","fetch_graph":"https://pith.science/api/pith-number/MZT5BHUOGCICVJQIXMF4PZKG57/graph.json","fetch_events":"https://pith.science/api/pith-number/MZT5BHUOGCICVJQIXMF4PZKG57/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57/action/storage_attestation","attest_author":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57/action/author_attestation","sign_citation":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57/action/citation_signature","submit_replication":"https://pith.science/pith/MZT5BHUOGCICVJQIXMF4PZKG57/action/replication_record"}},"created_at":"2026-07-08T01:19:09.495485+00:00","updated_at":"2026-07-08T01:19:09.495485+00:00"}