{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:F5KIEAQKKNBAV6MHLP3SPKPTRY","short_pith_number":"pith:F5KIEAQK","schema_version":"1.0","canonical_sha256":"2f5482020a53420af9875bf727a9f38e01098757400d39a6d0ae11852b195950","source":{"kind":"arxiv","id":"2501.14818","version":1},"attestation_state":"computed","paper":{"title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Amala Sanjay Deshmukh, Andrew Tao, Bryan Catanzaro, De-An Huang, Guilin Liu, Guo Chen, Hao Zhang, Ilia Karmanov, Jan Kautz, Jose M. Alvarez, Karan Sapra, Lukas Voegtle, Matthieu Le, Nadine Chang, Philipp Fischer, Shihao Wang, Shilong Liu, Shiyi Lan, Subhashree Radhakrishnan, Timo Roman, Tong Lu, Tuomas Rintamaki, Vibashan VS, Yilin Zhao, Yishen Ji, Zhiding Yu, Zhiqi Li","submitted_at":"2025-01-20T18:40:47Z","abstract_excerpt":"Recently, promising progress has been made by open-source vision-language models (VLMs) in bringing their capabilities closer to those of proprietary frontier models. However, most open-source models only publish their final model weights, leaving the critical details of data strategies and implementation largely opaque. In this work, we address VLM post-training from a data-centric perspective, showing the key role of data strategy in developing frontier VLMs. By studying and building our post-training data strategy from scratch, we share detailed insights into the development processes, aimi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.14818","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-01-20T18:40:47Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"d6202cc7bd0fbacb17373320233927bb4be16cacf6c6e49cf8db58f3dc8fe03e","abstract_canon_sha256":"12ace8496d7ce62f58de75050183b4d054084b71df2ea5ea6ec494b9e95bba81"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:05:19.090063Z","signature_b64":"8PFM5TE3g77Vkt1TstlITPK/dsi3381NWSluapn4vYEF8IIjcyLmrDdKCEa7Ndc39Alr4wUWUzzSgZRq/RTtAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2f5482020a53420af9875bf727a9f38e01098757400d39a6d0ae11852b195950","last_reissued_at":"2026-07-05T10:05:19.089572Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:05:19.089572Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Amala Sanjay Deshmukh, Andrew Tao, Bryan Catanzaro, De-An Huang, Guilin Liu, Guo Chen, Hao Zhang, Ilia Karmanov, Jan Kautz, Jose M. Alvarez, Karan Sapra, Lukas Voegtle, Matthieu Le, Nadine Chang, Philipp Fischer, Shihao Wang, Shilong Liu, Shiyi Lan, Subhashree Radhakrishnan, Timo Roman, Tong Lu, Tuomas Rintamaki, Vibashan VS, Yilin Zhao, Yishen Ji, Zhiding Yu, Zhiqi Li","submitted_at":"2025-01-20T18:40:47Z","abstract_excerpt":"Recently, promising progress has been made by open-source vision-language models (VLMs) in bringing their capabilities closer to those of proprietary frontier models. However, most open-source models only publish their final model weights, leaving the critical details of data strategies and implementation largely opaque. In this work, we address VLM post-training from a data-centric perspective, showing the key role of data strategy in developing frontier VLMs. By studying and building our post-training data strategy from scratch, we share detailed insights into the development processes, aimi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.14818","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.14818/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.14818","created_at":"2026-07-05T10:05:19.089630+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.14818v1","created_at":"2026-07-05T10:05:19.089630+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.14818","created_at":"2026-07-05T10:05:19.089630+00:00"},{"alias_kind":"pith_short_12","alias_value":"F5KIEAQKKNBA","created_at":"2026-07-05T10:05:19.089630+00:00"},{"alias_kind":"pith_short_16","alias_value":"F5KIEAQKKNBAV6MH","created_at":"2026-07-05T10:05:19.089630+00:00"},{"alias_kind":"pith_short_8","alias_value":"F5KIEAQK","created_at":"2026-07-05T10:05:19.089630+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":25,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19100","citing_title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17256","citing_title":"Contrastive Action-Image Pre-training for Visuomotor Control","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19100","citing_title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07383","citing_title":"RhinoVLA Technical Report","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07100","citing_title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04300","citing_title":"Argus-Retriever: Vision-LLM Late-Interaction Retrieval with Region-Aware Query-Conditioned MoE for Visual Document Retrieval","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07100","citing_title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19100","citing_title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07383","citing_title":"RhinoVLA Technical Report","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29812","citing_title":"Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30282","citing_title":"Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22819","citing_title":"Cambrian-P: Pose-Grounded Video Understanding","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2507.05920","citing_title":"High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2507.16815","citing_title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2505.15659","citing_title":"FLARE: Robot Learning with Implicit World Modeling","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2504.05299","citing_title":"SmolVLM: Redefining small and efficient multimodal models","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04161","citing_title":"Adaptive Action Chunking at Inference-time for Vision-Language-Action Models","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24182","citing_title":"$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00078","citing_title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20012","citing_title":"EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19324","citing_title":"PLaMo 2.1-VL Technical Report","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18000","citing_title":"Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11589","citing_title":"MLLM-as-a-Judge Exhibits Model Preference Bias","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2503.14734","citing_title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2504.10479","citing_title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","ref_index":69,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY","json":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY.json","graph_json":"https://pith.science/api/pith-number/F5KIEAQKKNBAV6MHLP3SPKPTRY/graph.json","events_json":"https://pith.science/api/pith-number/F5KIEAQKKNBAV6MHLP3SPKPTRY/events.json","paper":"https://pith.science/paper/F5KIEAQK"},"agent_actions":{"view_html":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY","download_json":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY.json","view_paper":"https://pith.science/paper/F5KIEAQK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.14818&json=true","fetch_graph":"https://pith.science/api/pith-number/F5KIEAQKKNBAV6MHLP3SPKPTRY/graph.json","fetch_events":"https://pith.science/api/pith-number/F5KIEAQKKNBAV6MHLP3SPKPTRY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY/action/storage_attestation","attest_author":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY/action/author_attestation","sign_citation":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY/action/citation_signature","submit_replication":"https://pith.science/pith/F5KIEAQKKNBAV6MHLP3SPKPTRY/action/replication_record"}},"created_at":"2026-07-05T10:05:19.089630+00:00","updated_at":"2026-07-05T10:05:19.089630+00:00"}